같은 모델로 정답률 38.7%에서 54.0%
OpenAI가 판 것은 모델이 아니라 색인과 규칙이다
OpenAI가 법률 전용 묶음을 내놨다. 모델은 그대로 두고 검색 색인, 작성 지시문, 권한 통제를 붙였다. 정답률이 38.7%에서 54.0%로 올라갔다.
OpenAI가 9월 17일 법률 전용 구성인 Astra for Law를 공개했다. 새 모델을 훈련하지는 않았다. 기반은 기존 GPT-6 Astra 그대로다. 위에 세 가지를 얹었다. 법률 검색 색인, 법률 분석·작성용 지시문, 그리고 기밀 업무용 권한 통제다.
성능 차이는 이 세 가지에서만 나왔다. 벤치마크 비공개 검증셋 200문항에서 Astra for Law는 54.0%를 맞췄다. 웹 검색만 쓴 같은 모델은 38.7%였다. 절대 15.3%포인트, 상대 40% 차이다. 판례 질문에서는 참조 판례를 24% 더 찾았고 정확한 판결문에서 관련 구절을 최대 54% 더 끌어왔다.
색인 규모는 미국 판례·법령·규정·법원 규칙·행정심판 2억 3천만 URL 이상이고 매일 추가된다. CourtListener를 운영하는 비영리 단체와 협업해 공개된 미국 선례의 99.9% 이상을 포함시켰다.
한 줄 정리
OpenAI가 같은 모델에 법률 색인과 작성 규칙을 붙여 정답률을 38.7%에서 54.0%로 올리고 그 묶음에 따로 이름을 붙여 팔기 시작했다.
한눈에 보기
| 구성 요소 | 내용 |
|---|---|
| 기반 모델 | GPT-6 Astra (동일) |
| 추가된 것 | 법률 검색 색인, 분석·작성 지시문, 권한 통제 |
| 색인 범위 | 미국 판례·법령·규정·행정심판 2억 3천만 URL 이상 |
| 파트너 플러그인 | 26개 (Thomson Reuters, Relativity, Clio, iManage 등) |
| 커뮤니티 플러그인 | 9개, 커스텀 스킬 47개 |
| 접근 방식 | 선별 로펌 대상 Trusted Access, API는 준비 중 |
팔린 것은 성능이 아니라 통제다
발표문에서 분량을 많이 가져간 대목은 벤치마크가 아니라 거버넌스다. 대상 로펌에는 API 무보존 옵션이 들어가고 기업용 ChatGPT 사용분은 기본값으로 사람 검토에서 제외된다. 여기에 정보 권한, 이해상충 차단벽, 의뢰인 지시 반영, 로펌 감독 체계를 Latham & Watkins와 함께 설계 중이다.
법률 시장에서 이 줄이 성능표보다 앞선다. 의뢰인 기밀을 다루는 조직은 정답률이 몇 포인트 오르는 것보다 자료가 어디에 남는지를 먼저 묻는다. 그래서 Latham & Watkins는 성능 검증이 아니라 거버넌스 쪽 파트너로 이름을 올렸다.
두 층이 같이 열렸다
이 발표에는 층이 둘이다. 위층에서는 Harvey와 Legora 같은 법률 AI 업체가 API로 이 구성 위에 자기 제품을 올린다. 아래층에서는 로펌이 직접 도구를 만든다.
- Sullivan & Cromwell은 자사 협상 플레이북과 선별한 선례를 새 계약 검토에 물리는 분석기를 만들었다. 조항을 따로가 아니라 묶어 읽을 때 생기는 위험을 짚고 수정안 초안까지 낸다.
- Ropes & Gray는 자사 변호사가 데이터룸을 훑는 방식 그대로 실사 시스템을 짰다. 핵심 고객 계약에 통지나 동의 의무가 걸려 있는지 같은 질문을 인수 판단 전에 끌어올린다.
- Cooley는 상장 준비용 도구를 만들었다. 거래 조건이 바뀌면 그 변화를 서류 전체에 옮긴다.
이 셋은 OpenAI의 현장 배치 엔지니어와 함께 만들었다. 플랫폼을 파는 회사가 응용 층까지 내려와 같이 짓고 있다.
플러그인 구성도 같은 방향이다. 26개 파트너 플러그인 옆에 현업 변호사와 리걸 엔지니어가 만든 커뮤니티 플러그인 9개, 커스텀 스킬 47개가 함께 올라갔다. 일에 가장 가까운 사람이 만든 것이 카탈로그에 그대로 들어간다.
전문업체와의 거리
이 구조에서 기존 법률 AI 업체의 자리가 애매해진다. OpenAI는 생태계를 대체하지 않는다고 못 박았다. 색인은 Thomson Reuters 같은 곳이 라이선스한 콘텐츠와 전문 제품을 보완하는 위치라고 적었다.
Thomson Reuters 쪽 답도 같은 선을 긋는다. 연결만으로는 값이 안 되고 신뢰할 수 있는 지식, 사건 맥락, 고위험 업무에 필요한 거버넌스가 함께 와야 한다는 취지다. 자사 제품이 그 역할을 계속 맡고 OpenAI와의 협업은 고객이 고른 환경에서 그 기능을 쓰게 하는 일이라고 정리했다.
두 회사가 같은 문장을 다르게 읽고 있다. 한쪽은 기반을 깔았다고 말하고 다른 쪽은 기반 위의 판단은 여전히 우리 것이라고 말한다. 당장은 둘 다 맞다. 다만 색인이 매일 커지고 지시문이 계속 다듬어지는 쪽은 한 곳이다.
ChatGPT 워드 추가 기능도 같은 날 일반 공개됐다. 변호사가 늘 쓰던 문서 작성 도구 안에서 교정과 수정 제안을 받는다. 도구를 바꾸라고 요구하지 않는 경로를 함께 깐 셈이다.
위시클레이 관점
15.3%포인트는 모델을 더 키워서 얻은 게 아니다. 흩어져 있던 2억 3천만 URL을 한 색인으로 묶고, 그 자료를 어떻게 읽고 쓸지 규칙을 적고, 어디에 남기지 말지 정해서 얻었다. 셋 다 프런티어 연구소가 아니어도 할 수 있는 일이다.
한국 시장에는 같은 조건을 갖춘 영역이 널려 있다. 공개돼 있지만 흩어져 있고, 검색으로는 정확히 못 찾고, 틀리면 과태료가 나오는 규정 덩어리 말이다. 식품·화장품 표시광고 심의 기준, 의료광고 사전심의 사례, 학원 교습비 조정 기준, 공공 입찰 제안서 평가표, 지자체별 옥외광고물 조례가 전부 그렇다. 색인을 만드는 일은 모델을 만드는 일보다 두세 자릿수 싸다.
로펌 세 곳이 만든 것을 다시 보면 방향이 분명하다. 새 모델이 아니라 자기 플레이북을 모델에 물린 도구다. 십 년 쌓인 협상 기준, 실사 체크리스트, 상장 준비 순서가 그 도구의 값이다. 광고 대행사의 심의 반려 사례집, 교육 기업의 커리큘럼 설계 기준, 커머스 팀의 반품 판정 규칙도 정확히 같은 종류의 자산이다. 지금까지는 그게 선임자 머릿속과 흩어진 문서에 있었다.
여기서 순서를 헷갈리면 안 된다. 색인부터 만들고 나서 무엇에 쓸지 찾는 식으로는 돈만 쓴다. OpenAI가 먼저 정한 것은 색인이 아니라 평가 기준이다. 200문항짜리 검증셋을 놓고 참조 판례를 몇 개 더 찾았는지, 정확한 판결문에서 구절을 몇 % 더 끌어왔는지를 재면서 구성을 다듬었다. 채점표 없이 자료만 모으면 좋아졌는지 나빠졌는지 알 방법이 없다. 우리 쪽 채점표는 대개 이미 있다. 심의에 반려된 카피 50건, 고객이 수정 요청한 제안서 30건, 클레임이 들어온 상세페이지 20건 말이다. 지난 실패 기록이 그대로 문제지가 된다.
반대편 신호도 같이 읽어야 한다. 범용 모델에 프롬프트만 얹어 "계약서 검토 자동화"를 파는 서비스는 이번 발표로 값이 내려갔다. 팔 수 있는 자리는 남의 색인을 쓰기 편하게 포장하는 쪽에서 남이 못 가진 판단 기록을 쌓은 쪽으로 옮겨 갔다.