같은 날 두 회사가 값을 내렸다
입력 100만 토큰 0.1달러와 4달러 사이를 어떻게 나눌 것인가
OpenAI가 GPT-6 Sol과 Luna를 내면서 API 가격을 절반으로 낮췄다. 같은 날 Anthropic은 Claude Opus 5.5를 Opus 5보다 20% 싸게 걸었다. 단가는 내려가는데 청구서는 같이 내려가지 않는다.
9월 22일 하루에 프런티어 모델 가격표 두 장이 다시 찍혔다. OpenAI는 GPT-6 Sol과 GPT-6 Luna를 내놓으면서 API 가격을 GPT-5.6 프로모션가 대비 50% 내렸다. Sol이 입력 100만 토큰 $2에 출력 $10, Luna가 $0.10 / $0.50이다. 몇 시간 차로 Anthropic이 Claude Opus 5.5를 $4 / $20에 올렸다. Opus 5는 $5/$25였다.
한 줄 정리
하루 사이에 같은 급 작업을 돌리는 값이 절반으로 떨어졌고 이제 고를 것은 제일 똑똑한 모델이 아니라 작업마다 얼마짜리를 붙일지다.
한눈에 보기
| 모델 | 입력 | 출력 | 직전 세대 대비 |
|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.50 | 50% 인하 |
| GPT-6 Sol | $2 | $10 | 50% 인하 |
| Claude Opus 5.5 | $4 | $20 | 20% 인하 |
100만 토큰 기준. Opus 5.5는 단가를 20% 내린 데다 같은 일을 더 적은 토큰으로 끝내서 Anthropic은 작업당 비용을 Opus 5보다 40% 낮게 잡았다. 출력 속도도 30% 이상 빨라졌다. Sol과 Luna의 $2와 $0.10은 프로모션이 아니라 정가다.
싸진 것은 단가지 청구서가 아니다
OpenAI가 발표문에 자기 집 숫자를 적어 뒀다. 사내 연구원 한 명이 하루에 쓰는 토큰을 API 가격으로 환산하면 중앙값 $600, 상위 10%는 $7,000을 넘었다. 이 액수는 단가가 여러 차례 내려가는 동안 쌓였다.
값이 싸지면 에이전트는 더 오래 돈다. 한 번에 끝내던 일을 세 번 되짚고 읽다 말던 파일을 끝까지 읽는다. 예산을 잡아 본 팀은 이 순서를 안다. 단가 인하 소식을 듣고 한도를 올리면 그다음 달 청구서가 전보다 크다.
그래서 다음 달 청구액을 정하는 것은 가격표가 아니라 호출 수와 한 번당 토큰이다. 지금 돌리는 자동화의 하루 호출 수와 한 번당 평균 토큰을 모르면 이번 인하는 아무 데도 닿지 않는다. 대시보드에서 이 두 숫자를 먼저 찾아 두면 이번 주에 바로 쓸 수 있다.
두 번째 가격표는 캐시에 있다
OpenAI는 GPT-6에서 캐시된 입력 토큰 읽기에 90% 할인을 걸고 기본 적중률을 올렸다. 추론 강도를 대화 중간에 바꾸거나 도구를 켜고 꺼도 앞선 맥락이 캐시에 남는다. 캐시가 어디서 끊길지 직접 지정하는 기능도 열렸다. GitHub은 이 개선 덕에 수십억 건의 요청에서 새로 처리해야 하는 프롬프트 토큰 비중이 50% 이상 줄었다고 전했다. Anthropic도 Opus 5.5의 캐시 읽기를 Opus 5보다 60% 싸게 매겼다.
여기서 설계가 곧 돈이 된다. 프롬프트 앞쪽에 회사 지침, 제품 목록, 말투 규칙처럼 안 바뀌는 덩어리를 고정해 두고 고객마다 바뀌는 부분을 뒤로 밀면 같은 결과에 청구액이 달라진다. 반대로 매번 "오늘 날짜"를 맨 앞에 박아 두는 프롬프트는 하루에 한 번씩 캐시를 통째로 날린다. 콘텐츠 에이전시나 고객 문의를 자동 분류하는 팀처럼 같은 지침을 하루 수백 번 반복해 태우는 쪽일수록 차이가 크게 벌어진다.
비싸서 접어 둔 일이 다시 계산기에 올라온다
값이 반으로 떨어지면 새 기능이 생기는 게 아니라 접어 뒀던 목록이 되살아난다. 숫자를 대 보면 감이 빨리 온다. 상품 5,000개의 설명을 다시 쓴다고 치자. 한 건에 입력 800토큰, 출력 400토큰을 잡으면 입력 400만 토큰에 출력 200만 토큰이다. Luna로 돌리면 입력 $0.40에 출력 $1.00, 합쳐 1.4달러 남짓이다. 지난 3년 치 고객 문의 3만 건을 주제별로 다시 분류하는 일도 비슷한 자릿수에서 끝난다.
작년에 견적을 뽑아 보고 미뤄 둔 일이 있다면 그 견적서는 이미 두 배쯤 틀렸다. 다시 계산하는 데 10분이면 된다. 계산해 보고 여전히 비싸면 그건 모델 값이 아니라 설계 문제다. 싸졌으면 이번 주에 돌리면 된다.
위시클레이 관점
$0.10과 $4 사이는 40배다. 이 폭을 한 가지 선택으로 덮으면 둘 중 하나로 진다. 제일 좋은 모델을 전부에 붙이는 쪽은 문의 태깅에 Opus 5.5를 태운다. 제일 싼 모델을 전부에 붙이는 쪽은 계약서 검토를 100만 토큰 $0.10짜리에 맡긴다. 40배라는 숫자가 작업을 나누라고 말한다.
나누는 기준은 성능이 아니라 틀렸을 때 드는 비용이다. 문의를 잘못 분류하면 담당자가 3초 만에 고친다. 견적서 숫자가 틀리면 고객 앞에서 고친다. 이 두 줄에 같은 모델이 붙어 있으면 둘 중 하나는 잘못 붙어 있다.
종이 한 장이면 된다. 이번 주에 모델에 시키는 일을 줄로 적고 각 줄 옆에 지금 붙은 모델과 그 줄이 틀렸을 때 생기는 일을 적는다. 1인 SaaS를 굴리는 사람이면 스무 줄 안쪽에서 끝나고 열 명 남짓한 콘텐츠 팀도 서른 줄을 넘기기 어렵다. 그 표에서 아래쪽 절반을 Luna급으로 내리는 일이 오늘 인하를 실제로 주머니에 넣는 유일한 동작이다. 값이 내려간 날 아무것도 안 바꾸면 내려간 것은 남의 값이다.