시험지 15개 중 9개가 결함 판정을 받았다
어제 신모델 발표에 인용된 것도 그 안에 있다
Epoch AI가 벤치마크 자체를 감사하기 시작했다. 첫 15개 중 9개가 결함 판정이다. DeepSWE는 113개 과제 중 최소 23개에서 제대로 고친 답이 0점으로 기록됐다.
모델 점수를 매기는 시험지를 누가 채점하나. Epoch AI가 9월 17일 그 일을 하겠다며 Benchmark Reviews를 열었다. 첫 회차 15개 중 판정은 이렇게 갈렸다. 통과 4개, 결함 9개, 판단할 정보가 모자란 것 2개. 이름이 걸린 쪽에는 Humanity's Last Exam과 SWE-bench Verified가 들어 있다.
한 줄 정리
모델 순위를 만드는 시험지 절반 이상이 결함 판정을 받아서 이제 리더보드 1위는 도입 근거로 쓰기 어려워졌다.
한눈에 보기
| 첫 회차 검토 | 15개 (통과 4, 결함 9, 정보 부족 2) |
| 결함 판정 기준 | 표본의 20% 이상에 오류, 또는 채점을 통째로 오염시키는 문제 하나 |
| DeepSWE v1.1 | 113개 과제 중 최소 23개(20.3%)에서 오류 확인 |
| Terminal Bench 4.0 | 과제의 45.5%가 깨져 있음 |
| Humanity's Last Exam | 표본 문항의 46%가 결함 |
점수가 틀린 게 아니라 채점기가 틀렸다
DeepSWE 사례가 구조를 그대로 보여 준다. 채점기는 에이전트가 제출한 변경을 새 컨테이너에 얹은 뒤 숨겨 둔 테스트를 덧붙이는데, 그 전에 에이전트가 기존 테스트 파일에 손댄 부분을 지운다. 지시문 어디에도 테스트를 건드리지 말라는 말은 없다. 그래서 모델이 테스트를 추가하면 이름이 겹쳐 패키지가 컴파일되지 않고 제출은 실패로 기록된다. 코드는 제대로 고쳐 놓고도 0점을 받는다.
Epoch이 확인한 오류 23건 중 18건(78%)이 이 한 가지 원인이다. 나머지도 성격이 비슷하다. 지시문에 없던 조건을 숨은 테스트가 요구하거나 배치 알고리즘을 정해 주지 않은 채 특정 구현만 정답으로 인정하는 식이다.
이 결함이 특정 회사 편을 드는 것은 아니다. Epoch의 오류 표에 걸린 실패 기록에는 Opus, Fable, Sol, Grok, Gemini, Qwen, Kimi, DeepSeek, GLM이 고르게 들어 있다. 기울어져 있다기보다 바닥이 흔들린다. 그리고 흔들리는 바닥 위에서 잰 1.1%p 차이는 아무것도 말해 주지 않는다.
어제 발표에 그 시험지가 있었다
OpenAI는 어제 GPT-6 Sol 발표문에서 DeepSWE v1.1 점수를 걸었다. Sol이 max 설정에서 68.8%, Claude Fable 5의 최고 기록 69.9%와 1.1%p 차이고 과제당 비용은 약 80% 낮다는 내용이다. Epoch이 DeepSWE를 검토한 날짜는 9월 7일이다. 판정은 발표보다 보름 앞서 나와 있었다.
이걸 OpenAI의 잘못으로 읽으면 요점을 놓친다. 모델을 파는 쪽은 업계가 공유하는 시험지를 쓸 수밖에 없고 그 시험지를 검증할 유인은 파는 쪽에 없다. 검증을 아무도 안 맡는 자리가 몇 년째 비어 있었다. 그 자리가 비어 있는 동안 우리는 발표 슬라이드의 막대 길이를 보고 계약을 바꿨다.
결함 판정이 쓸모없다는 뜻은 아니다
여기서 방향을 반대로 틀면 또 틀린다. Flawed는 그 시험지를 버리라는 표시가 아니라 해석에 조건이 붙는다는 표시다. Epoch도 판정 기준을 공개해 뒀다. 표본의 20% 이상에 오류가 있거나 채점을 전면적으로 오염시키는 문제가 하나 있으면 결함으로 본다. 첫 회차에서 네 개는 통과했고 두 개는 판단할 자료가 모자라 보류됐다. 자기가 만든 벤치마크는 이해 충돌을 이유로 검토하지 않는다는 원칙도 함께 적었다.
그래서 다음에 모델 발표문을 읽을 때 순서가 하나 늘었다. 점수를 보기 전에 시험지 이름을 보고, 그 이름이 검토를 받았는지 확인하고, 두 모델의 점수 차가 그 시험지의 오류율보다 큰지 따진다. 5%p 차이를 두고 고민하는 상황에서 시험지 오류율이 20%라면 고민할 대상이 아니다.
위시클레이 관점
68.8%와 69.9%를 놓고 어느 모델로 갈아탈지 회의하는 동안에도 그 시험지는 다섯 과제 중 하나꼴로 정답에 0점을 준다. 소수점 한 자리를 따지는 일이 의미를 잃는 지점이 여기다.
대신 만들 것은 우리 업무로 만든 시험지다. 지난달 팀이 모델에 반복해서 시킨 일 중 스무 개를 뽑고 각각에 우리가 이미 정답을 아는 입력과 출력을 한 쌍씩 붙인다. 문의 200건의 실제 분류 결과, 작년에 사람이 쓴 상세페이지 열 개, 지난 분기 견적서 다섯 장이면 된다. 이 스무 문항은 하루면 만들고 새 모델이 나올 때마다 30분이면 돌린다.
이 시험지는 Epoch이 못 잡는 것까지 잡는다. 우리 업종의 용어를 헷갈리는지, 우리 브랜드 말투를 지키는지, 고객이 실제로 쓰는 비문에 걸려 넘어지는지는 어떤 공개 벤치마크에도 안 들어 있다. 1인 에이전시든 열 명짜리 커머스 팀이든 이 스무 줄이 리더보드 열 개보다 정확하다. 남의 시험지가 흔들린 날은 내 시험지를 만들 날이다.