기술 신호2026-09-14

실제 회사 코드로 재자 1위가 38.8%

여덟 모델이 64번 붙어 0번 통과한 과제도 있다

Specific Labs가 실제 기업에서 라이선스한 비공개 프로덕션 코드베이스로 코딩 에이전트를 재는 Real-SWE를 냈다. 모델·하네스 조합 8개에 롤아웃 640회를 돌려 최고 성적이 38.8%다. 시간을 더 줘도 돈을 더 써도 숫자가 따라오지 않았다.

코딩 에이전트를 팀에 들일지 재는 중이라면 이 숫자를 먼저 보는 편이 낫다. Specific Labs가 9월에 Real-SWE를 공개했다. 실제 회사에서 라이선스한 비공개 프로덕션 코드베이스에서 과제 10개를 뽑고, 모델과 하네스 조합 8개를 붙여 채점된 롤아웃 640회를 돌린 결과다. 1위는 Fable 5.1에 Claude Code를 물린 조합으로 38.8%다.

과제를 고른 자리가 다르다. 이용자 20만 명이 넘고 앱스토어 100위 안에 든 행사 서비스, 은행 거래내역 10만 건 이상을 처리하는 소비자 핀테크, 기업용 AI 세일즈 플랫폼. 그 회사 엔지니어가 실제로 배정받아 처리한 일을 그대로 옮겼다. 세금을 제대로 매기고, 고객을 이관하고, 청구서를 맞추는 종류의 작업이다.

한 줄 정리

인터넷 어디에도 답이 없는 실제 회사 코드로 옮기자 최고 성적이 38.8%까지 내려앉았다.

한눈에 보기

순위 모델 · 하네스 해결률 롤아웃당 비용
1 Fable 5.1 · Claude Code 38.8% $6.96
2 GPT-6 Astra · Codex CLI 33.8% $4.67
3 Gemini 3.8 Flash · Gemini CLI 31.2% $2.50
4 GLM 5.3 · Claude Code 28.8% $5.12
5 Grok 4.6 · Grok Build 23.8% $3.44
5 Muse Spark 1.3 · Muse Code 23.8% $2.74
7 Kimi K3 · Kimi Code 18.8% $3.90
8 GPT-5.6 Sol · Codex CLI 16.2% $2.65

해결률은 과제마다 8회씩 독립 실행한 pass@1 평균이다.

절반 이상의 과제에서 다 같이 막혔다

과제 10개 중 6개가 해결률 15% 아래다. 분석 스트림 리듀서 과제는 여덟 모델이 각각 8번씩, 합쳐서 64번 붙어 한 번도 통과하지 못했다. 세금 관할 과제는 64번 중 2번만 통과해 3.1%, 선형화 가능 스캔은 4.7%다.

반대쪽도 있다. 다중 리전 일괄 작업은 67.2%, API 키와 환경 분리는 65.6%로 절반을 넘겼다. 잘 되는 일과 안 되는 일이 모델별로 갈리는 게 아니라 과제별로 갈린다.

시간을 더 줘도 올라가지 않는다

10분 안에 끝난 롤아웃 98회 중 70회가 실패했다(71.4%). 10분을 넘긴 롤아웃 542회 중에서는 398회가 실패했다(73.4%). 오래 붙든 쪽이 오히려 조금 더 많이 틀렸다. 생각할 시간이 모자라서 못 푸는 종류의 문제가 아니다.

돈도 비슷하다. Gemini 3.8 Flash는 롤아웃당 $2.50에 31.2%를 냈고 GPT-6 Astra는 $4.67에 33.8%를 냈다. 2.6점을 더 얻는 데 값이 거의 두 배다. 가장 싼 축인 GPT-5.6 Sol은 $2.65에 16.2%로 꼴찌다. 비용과 성적이 나란히 가지 않는다.

실패하는 방식이 모델마다 다르다

모델 가장 잦은 실패 비율
Grok 4.6 요구사항 누락 61회 중 41회 (67.2%)
Kimi K3 요구사항 누락 65회 중 35회 (53.8%)
Gemini 3.8 Flash 연결 오류 55회 중 27회 (49.1%)
GPT-5.6 Sol 검증 안 한 가정 67회 중 29회 (43.3%)

연결 오류는 방향은 맞게 짰는데 주변 시스템에 잘못 물린 경우다. 검증 안 한 가정은 작업 공간에서 확인하는 대신 짐작 위에 쌓아 올린 경우다. 이름만 바꾸면 신입이 첫 달에 내는 실수 목록과 거의 같다.

회귀, 그러니까 멀쩡히 돌던 기능을 망가뜨린 비율은 낮다. 상위 모델에서 4% 안팎이고 세 모델은 0건이다. 망가뜨리기보다 덜 만들어 오는 쪽으로 실패한다.

위시클레이 관점

Real-SWE를 만든 쪽이 적어 둔 문장 하나가 이 결과 전체를 설명한다. 실제 기업 안에서 오가는 토큰의 99%는 프런티어 모델이 본 적이 없다. 참조 정답이 건드린 파일은 중앙값 11개이고 비교 대상으로 삼은 공개 벤치마크 두 곳은 6개다. 지시문 길이는 오히려 비슷하다. 중앙값 1,742자로 다른 벤치마크들과 비슷한 범위에 있다. 설명은 같은 분량인데 손대야 할 자리가 두 배 가까이 넓다.

모델이 못 하는 일은 코드를 짜는 게 아니라 그 회사가 여태 어떻게 해 왔는지 모르는 채로 짜는 일이다. 요구사항 누락과 검증 안 한 가정이 실패의 가장 큰 두 덩어리인 것도 같은 자리에서 나온다.

코드 얘기만은 아니다. 열두 명짜리 콘텐츠 팀이 에이전트에 랜딩 카피를 맡겨도 어긋나는 방식이 같다. 우리 브랜드가 절대 안 쓰는 표현, 법무가 매번 잡아내는 문구, 작년에 이미 죽어 본 훅. 전부 사람 머릿속에만 있고 문서에는 없다. 그 자리에서 모델은 그럴듯한 쪽을 고른다. 그게 검증 안 한 가정이다.

적어 두는 일에는 요령이 있다. 규칙을 추상적으로 쓰면 안 쓴 것과 비슷해진다. 금지 표현 목록, 실제로 반려된 문장 예시, 승인 담당자와 기준 같은 것을 원문 그대로 남겨 두는 편이 낫다. 벤치마크에서 통과율이 높았던 과제들도 지시가 똑똑해서 풀린 게 아니라 확인할 자리가 코드 안에 이미 있어서 풀렸다.

그래서 다음에 돈을 더 쓸 자리는 더 비싼 모델이 아니라 우리 규칙을 글로 옮기는 쪽이다. $6.96짜리 롤아웃이 38.8%에서 멈춘 걸 모델 탓으로 돌리면 다음 모델을 기다리는 일밖에 안 남는다. 지금 적어 둘 수 있는 것부터 적어 두면 기다리는 동안에도 쓸 게 생긴다.

참고