기술 신호2026-09-15

1위에 0.9포인트 뒤지고 값은 64% 싸다

Cognition이 남이 푼 가중치 위에 코딩 모델을 얹었다

Cognition이 9월 10일 SWE-2를 공개했다. Kimi K3를 후속학습해 FrontierCode 1.1 Main에서 50.0%를 받았다. 1위와 0.9포인트 차인데 과제당 값은 64% 낮다.

코딩 에이전트 순위표에서 1위와 2위의 점수 차이가 0.9포인트다. 값 차이는 세 배 가까이 난다. Cognition이 9월 10일 공개한 SWE-2는 FrontierCode 1.1 Main에서 50.0%를 받았다. 같은 벤치마크 1위인 Fable 5.1 Medium이 50.9%에 과제당 3.28달러다. SWE-2는 그 값에서 64%를 깎았다.

한 줄 정리

Cognition이 Kimi K3를 후속학습해 만든 SWE-2가 1위에 0.9포인트 뒤지면서 과제당 값은 64% 낮췄다.

한눈에 보기

모델 FrontierCode 1.1 Main DeepSWE 1.1 Terminal-Bench 4
GPT-6 Astra 53.3% 74.1% 57.9%
Fable 5.1 50.9% 67.4% 55.8%
SWE-2 50.0% 73.0% 27.3%
Kimi K3 (베이스) 44.2% 68.5% 21.5%
SWE-1.7 (이전 모델) 42.0% 37.7% 7.6%

남의 가중치 위에서 5.8포인트를 벌었다

SWE-2의 베이스는 Moonshot의 Kimi K3다. 2.8조 파라미터짜리 모델이고 이미 에이전트 코딩용 강화학습을 크게 돌려 놓은 상태였다. Cognition은 파운데이션 모델을 처음부터 훈련하는 대신 그 위에 자기 강화학습을 한 번 더 얹었다. 44.2%가 50.0%가 됐다. DeepSWE 1.1에서도 68.5%에서 73.0%로 올랐다.

회사가 자기 파운데이션 모델을 가졌느냐가 이 시장의 입구였던 시절이 있었다. 지금은 남이 공개한 가중치에서 출발해 자기 작업 분포로 마무리하는 쪽이 점수와 값을 같이 가져간다. SWE-2가 만든 자리는 GPT-6 Astra에 몇 포인트 못 미치면서 값은 4분의 1인 구간이다.

다만 오픈 가중치에서 출발했다고 결과까지 열리지는 않는다. SWE-2는 Devin Desktop과 CLI에서 먼저 쓸 수 있고 Devin Web과 Fusion으로 순차 배포된다. 베이스는 공개돼 있어도 그 위에 얹은 강화학습 결과물은 Cognition 제품 안에 남는다.

청구서 대부분은 지능이 아니라 헤맨 값이다

SWE-2 medium은 이전 모델 SWE-1.7보다 점수가 높으면서 턴 수는 58% 적고 값은 81% 싸다. 과제당 평균 스텝이 127에서 53으로 줄었다. 첫 실제 코드 편집에 들어가기까지 SWE-1.7은 중앙값 48스텝을 썼는데 SWE-2 medium은 18스텝을 쓴다.

줄어든 자리는 탐색이다. 코드베이스에서 이번 과제에 실제로 관계있는 부분을 골라내는 판단이 좋아지면 읽고 grep하는 횟수가 줄고 그만큼 토큰이 안 나간다. 같은 답을 내는 두 실행의 값 차이는 답의 질이 아니라 읽은 파일 수에서 벌어진다.

최고 등급이 항상 이기지 않는다

Cognition은 medium·high·max 세 노력 단계를 하나의 강화학습 실행 안에서 함께 학습시켰다. 비용 페널티를 단계마다 선형으로 걸었고 그 계수를 베이스 모델 파레토 곡선의 국소 기울기에 맞췄다. 스텝 수도 등급별로 갈린다. medium 53, high 80, max 98이다.

같은 발표의 각주가 더 실용적이다. Fable 5.1 Max는 FrontierCode 1.1 Main에서 50.3%에 과제당 12.83달러다. Medium은 50.9%에 3.28달러다. 등급을 최고로 올리면 네 배를 내고 0.6포인트를 잃는다.

SWE-2가 다 이기지도 않는다. Terminal-Bench 4에서는 27.3%로 Fable 5.1의 55.8% 절반에 그친다. 값으로 이기는 모델과 어려운 터미널 과제에서 이기는 모델이 갈라져 있다. 순위표 한 줄만 보고 도구를 바꾸면 그 갈라진 자리를 그대로 밟는다.

위시클레이 관점

다섯 명짜리 팀이 코딩 에이전트에 매달 수백 달러를 쓰고 있다면, 정할 게 모델 이름이 아니라 기본 노력 단계다. Fable 5.1에서 Max를 기본값으로 두면 과제당 3.28달러가 12.83달러가 되는데 점수는 50.9%에서 50.3%로 내려간다. 최고 등급 버튼은 보험처럼 보이지만 청구서에서는 그냥 네 배다.

줄일 자리도 스텝 수가 알려 준다. 127스텝짜리 탐색과 53스텝짜리 탐색을 가른 건 모델 등급이 아니라 어디를 읽을지 아는 판단이었다. 사람 쪽에서 같은 효과를 내는 방법은 이미 알려져 있다. 과제를 작게 쪼개 주고, 건드릴 파일과 안 건드릴 파일을 미리 적어 주고, 무엇을 통과해야 끝인지 정의해 주는 일이다. 셋 다 max 버튼보다 싸게 먹힌다.

실무에서 이걸 확인하는 방법은 간단하다. 지난달 에이전트 청구서를 열어 과제 건수로 나눠 보면 과제당 단가가 나온다. 그 숫자가 3달러대인지 12달러대인지에 따라 다음 달에 손댈 곳이 정해진다. 12달러대라면 모델을 바꾸기 전에 기본 등급부터 내려 보는 쪽이 순서다. 점수가 그대로면 그날로 4분의 1이 줄고, 떨어지면 그때 올려도 늦지 않다.

순위표가 이렇게 촘촘해진 상황 자체도 신호다. 상위 다섯 모델이 FrontierCode 1.1 Main에서 44.2%부터 53.3% 사이에 몰려 있다. 어느 쪽을 골라도 답의 질에서 팀이 갈릴 여지는 9포인트 안쪽이다. 나머지 차이는 과제를 어떻게 잘라 주느냐에서 난다.

참고