입력 100만 토큰 2달러, 자율 실행은 26%
Grok 4.7은 어디에 싼가
xAI가 Grok 4.7을 공개했다. 값은 입력 100만 토큰 2달러, 출력 6달러다. 종합 지능 지수 46으로 중위권이고 에이전트 코딩 벤치마크에서는 26%에 그쳤다. 토큰 단가와 성공률을 같이 봐야 계산이 맞는다.
xAI가 9월 21일 Grok 4.7을 내놨다. 값은 입력 100만 토큰 2달러, 출력 6달러다. 서구 프런티어 모델보다 중국 오픈 모델 쪽에 가까운 가격표다. 같은 날 Vercel은 AI Gateway에서 이 모델을 40% 할인으로 열었고 Cursor와 Grok Build에서도 바로 쓸 수 있다.
싼 데는 이유가 있다. 독립 평가인 Artificial Analysis 지능 지수 v4.3.2에서 Grok 4.7은 46점을 받았다. Claude Fable 5.1과 GPT-6는 나란히 53점이다.
한 줄 정리
xAI가 프런티어 절반 값에 Grok 4.7을 열었지만 여러 단계를 스스로 밟는 작업에서는 상위권과 두 배 넘게 벌어졌다.
한눈에 보기
| 항목 | Grok 4.7 | 비교 |
|---|---|---|
| 입력 100만 토큰 | $2 | Grok 4.6과 동일 |
| 출력 100만 토큰 | $6 | |
| Artificial Analysis 지능 지수 v4.3.2 | 46 | Claude Fable 5.1 53, GPT-6 53 |
| Terminal-Bench 4.0 | 26% | GPT-6 Astra 60%, Claude Fable 5.1 55% |
| DeepSWE v1.1 고노력 | 71.0% | Grok 4.6은 65.2% |
값을 안 올린 게 이번 발표의 핵심이다
xAI 설명은 더 큰 기반 모델 위에 강화학습을 더 오래 돌렸고 자기 출력을 검증하는 능력과 긴 컨텍스트 관리를 손봤다는 쪽이다. 자사 비교인 DeepSWE v1.1 고노력 설정에서 65.2%에서 71.0%로 올랐다.
값표에는 갈래가 하나 더 있다. 더 빠른 Grok 4.7 Fast는 두 배 단가이고 공개 API로는 안 열린다. Cursor와 Grok Build 안에서만 쓴다. 미국 지역 엔드포인트를 지정하면 전역 요금의 1.1배가 붙는다. 같은 모델을 어디서 부르느냐에 따라 청구서가 갈린다.
눈에 띄는 대목은 성능이 아니라 값이다. Grok 4.6과 같은 단가를 유지했다. 세대가 올라갈 때 값을 같이 올리던 관행이 깨진 지는 좀 됐고 이번엔 아예 프런티어 가격대를 비워 두고 중간 자리를 차지했다. 분류와 요약처럼 호출 수가 많고 판단이 단순한 일에는 이 값이 잘 듣는다.
벌어지는 자리는 자율 실행이다
Terminal-Bench 4.0은 모델에 터미널을 주고 여러 단계를 스스로 밟게 하는 시험이다. 여기서 Grok 4.7은 26%에 머물렀다. GPT-6 Astra가 60%, Claude Fable 5.1이 55%다. 더 싼 DeepSeek V4.1 Flash가 27%로 근소하게 앞선다.
대화 품질과 자율 실행 능력이 갈라진 지표라는 점이 중요하다. 한 번 물어보고 한 번 답 받는 일은 46점 모델로도 충분히 굴러간다. 사람이 자리를 비운 사이 파일을 고치고 명령을 실행하고 결과를 확인하는 일은 다른 근육을 쓴다. 26%는 네 번 중 세 번은 사람이 뒤처리를 한다는 뜻이다.
한 가지 더 눈에 띈다. Artificial Analysis 측정에서 Grok 4.7의 상위 두 추론 설정이 거의 같은 점수를 냈다. 추론을 더 많이 돌리라고 설정을 올려도 결과가 따라 오르지 않았다는 뜻이다. 어려운 작업일수록 설정을 최대로 올리고 보는 습관이 여기서는 토큰만 더 태운다.
팀에서 나누는 기준
일감을 두 줄로 나눠 적어 두면 선택이 쉬워진다. 호출이 잦고 실패해도 즉시 눈에 띄는 일은 값으로 고른다. 문서 분류, 메일 초안, 상품 설명 다듬기, 리뷰 요약이 여기 들어간다. 사람이 안 보는 동안 여러 단계를 밟고 결과가 시스템에 남는 일은 성적으로 고른다. 코드 수정, 데이터 이관, 결제나 발송을 건드리는 작업이 그쪽이다.
값만 보고 후자를 싼 모델에 넘기면 절약분이 뒤처리 시간으로 되돌아온다. 토큰 값 차이가 열 배라도 실패율이 두 배면 사람 시간으로 다 까먹는다.
계산해 보면 금방 드러난다. 상품 설명 2,000건을 다듬는 데 출력 토큰이 건당 500개씩 들어간다고 치면 백만 토큰이고 6달러다. 같은 6달러로 자율 코딩 작업을 네 번 돌리면 26% 성공률에서는 한 번 건진다. 나머지 세 번은 중간에 멈춘 결과물을 사람이 읽고 정리한다. 절약한 돈은 몇 달러고 태운 시간은 반나절이다.
모델을 갈아타는 기준도 같은 식으로 잡힌다. 지금 쓰는 조합에서 사람이 손대는 비율을 두 주만 세어 보면 어느 쪽이 새는지 보인다. 벤치마크 표보다 그 숫자가 우리 일감에 가깝다.
위시클레이 관점
출력 100만 토큰 6달러는 분류와 요약을 하루 수천 건 돌리기에 좋은 값이다. 같은 모델에 터미널을 열어 주고 세 시간짜리 작업을 맡기면 성공률이 26%다. 실패한 74%를 사람이 다시 본다. 모델을 비교할 때 토큰 단가 옆 칸에 성공률을 같이 적어야 계산이 맞는다.
한 모델로 팀을 통일하려는 습관이 제일 비싸다. 도구 하나로 정리하면 관리가 편해지는 대신 가장 비싼 모델 값을 가장 단순한 작업에도 물거나, 반대로 가장 싼 모델을 가장 위험한 작업에 붙이게 된다. Grok 4.7이 27%짜리 DeepSeek V4.1 Flash에 Terminal-Bench에서 뒤졌다는 사실이 그 위험을 그대로 보여 준다. 싸다는 이유로 자율 실행까지 넘기면 더 싼 모델보다도 못한 구간에 들어간다.
API 키를 두 개 쓰는 불편은 하루면 익숙해진다. 잘못 고른 모델이 새벽에 망가뜨린 데이터를 복구하는 데는 그보다 오래 걸린다.