기술 신호2026-08-06

출력 100만 토큰이 6달러에서 1.2달러로

GPT-5.6 Luna 80% 인하, 이제 승부는 라우팅이다

OpenAI가 7월 30일 GPT-5.6 Luna 가격을 약 80% 내렸다. 출력 100만 토큰이 6달러에서 1.2달러로. 토큰 값이 제약에서 풀리면 남는 실력은 어떤 작업을 어느 모델로 보내느냐, 즉 라우팅이다.

가격 전쟁이 한 칸 더 내려갔다. OpenAI가 7월 30일 저가 티어인 GPT-5.6 Luna 가격을 약 80% 내렸다. 입력 100만 토큰이 1달러에서 0.20달러로, 출력이 6달러에서 1.2달러로 떨어졌다. 합산 기준 7달러가 1.4달러가 됐다.

이 가족은 셋으로 나뉜다. 가장 센 Sol은 입력 100만 토큰 5달러, 균형형 Terra는 2달러, 속도·저가형 Luna는 이제 0.20달러다. 같은 회사 안에서 가장 비싼 티어와 가장 싼 티어의 입력 단가가 25배 벌어졌다.

한눈에 보기

모델 입력 (100만 토큰) 성격
Sol $5 최상위 추론
Terra $2 균형
Luna $0.20 (인하 전 $1) 속도·저가

Luna 출력은 $6에서 $1.2로, 문맥 창은 약 105만 토큰, 최대 출력 12만 8천 토큰이다.

토큰 값이 제약에서 풀렸다

1년 전만 해도 프롬프트를 짧게 쓰고 문맥을 아끼는 게 미덕이었다. 토큰이 곧 돈이었으니까. Luna 단가에서는 분류·요약·추출 같은 대량 반복 작업의 토큰 비용이 반올림 오차에 가까워진다. 하루 10만 건을 요약해도 청구서가 몇 달러 수준이다.

값이 싸졌다고 문제가 사라진 건 아니다. 제약이 옮겨 갔을 뿐이다. 이제 실수는 다른 데서 난다. 간단한 태그 붙이기에 Sol을 들이대면 25배 비싼 청구서가 오고, 진짜 추론이 필요한 자리에 Luna를 쓰면 틀린 답이 빠르게 나온다. 값이 아니라 배치가 실력이 됐다.

승부는 라우팅으로 옮겨 갔다

모델 접근 자체는 이제 누구나 가진 부품이다. 차이는 그 위에 얹는 라우팅 층에서 난다. 들어오는 요청을 읽고 어떤 건 Luna로, 어떤 건 Terra로, 정말 어려운 것만 Sol로 보내는 규칙. 이걸 잘 짜면 같은 결과물을 몇 분의 일 비용으로 만든다.

AI 제품을 파는 1인 개발자에게 이건 마진의 위치가 바뀌었다는 뜻이다. 예전엔 "어느 모델을 쓰느냐"가 자랑거리였다. 지금은 다 같은 모델을 쓴다. 남는 건 요청을 분해해 값싼 티어로 최대한 밀어내고 비싼 티어를 아껴 쓰는 설계다. 사용자는 품질을 그대로 느끼고 원가만 내려간다. 그 차액이 마진이다.

위시클레이 관점

Luna 인하의 진짜 뉴스는 "싸졌다"가 아니라 "이제 아무도 토큰 값으로는 못 이긴다"는 것이다. 가장 싼 티어가 출력 100만 토큰 1.2달러면 경쟁사도 곧 비슷해진다. 원가 우위는 하루면 사라진다.

그래서 값이 붙는 자리가 모델에서 라우팅으로 내려왔다. 한 요청을 뜯어 어느 조각을 0.20달러짜리 Luna로 보내고 어느 조각만 5달러짜리 Sol에 남길지 정하는 판단, 이건 API 키로 살 수 없다. 자기 제품의 요청 패턴을 아는 사람만 짤 수 있다. 모델은 상향 평준화된다. 그 위에서 요청을 나누는 규칙이 곧 제품의 원가표이자 유일하게 남는 해자다. 지금 물어야 할 건 "무슨 모델을 쓸까"가 아니라 "내 요청의 몇 퍼센트를 싼 티어로 내려보낼 수 있나"다.

참고