기술 신호2026-08-05

2.4조 파라미터 프런티어가 출력 100만 토큰 6달러다

Qwen3.8 Max, 다음 주 가중치까지 푼다

알리바바가 8월 3일 Qwen3.8 Max를 정식 공개했다. 2.4조 파라미터 MoE에 1M 컨텍스트, 가격은 입력 100만 토큰 2달러 출력 6달러다. Terminal-Bench 2.1 86.6, GPQA Diamond 92.6을 찍었고 가중치는 다음 주 공개 예정이다.

프런티어급 성능과 저가 프런티어라는 말이 한 모델에 붙었다. 알리바바가 8월 3일 정식 공개한 Qwen3.8 Max는 2.4조 파라미터 MoE(mixture-of-experts) 구조에 1M 토큰 컨텍스트를 갖췄다. 가격이 본론이다. 입력 100만 토큰 2달러, 출력 100만 토큰 6달러, 캐시 입력은 0.25달러다.

숫자도 장식이 아니다. Artificial Analysis 인텔리전스 인덱스에서 53점을 받아 비슷한 가격대 추론 모델 중앙값 32점을 크게 웃돌았다. 알리바바가 낸 벤치마크는 Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1이다. Bloomberg는 이 점수대를 Anthropic에 필적한다고 표현했다.

한눈에 보기

구조 2.4조 파라미터 MoE, 1M 컨텍스트
가격 입력 100만 토큰 2달러 / 출력 6달러 / 캐시 0.25달러
인텔리전스 인덱스 53점 (동급 중앙값 32)
주요 벤치마크 Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1
가중치 다음 주 오픈웨이트 공개 예정
공개일 2026-08-03, 정식 제공

가격이 성능을 따라오지 못하던 시절이 끝났다

작년까지는 상위 벤치마크를 찍은 모델이 출력 100만 토큰에 수십 달러를 불렀다. Qwen3.8 Max는 그 점수대를 6달러에 판다. 분류·요약 같은 대량 반복 작업에 상위 모델을 들이밀어도 청구서가 자릿수를 바꾸지 않는다는 뜻이다.

여기에 다음 주 가중치 공개가 겹친다. API로 쓰다가 민감한 데이터는 자체 서버에 올린 같은 모델로 돌리는 선택지가 열린다. 폐쇄형 상위 모델과 오픈웨이트 사이에서 하나만 고르던 구도가 흐려진다.

벤치마크 우위는 며칠짜리다

Qwen3.8 Max가 Anthropic 점수대에 닿았다는 건 반대로 그 격차가 며칠이면 좁혀진다는 신호이기도 하다. DeepSeek-V4-Flash가 지난달 재훈련만으로 자사 플래그십을 넘겼고 이번엔 알리바바가 2.4조 모델로 상단을 건드렸다. 프런티어 성능은 특정 회사의 자산이 아니라 분기마다 갈아치워지는 소모품에 가까워졌다.

그래서 이번 릴리스에서 오래 남을 건 벤치마크 숫자가 아니라 가격표와 오픈웨이트 정책이다. 성능은 곧 따라잡히지만 원가 구조와 배포 자유도는 도입 결정에 계속 영향을 준다.

위시클레이 관점

출력 100만 토큰 6달러 모델이 오픈웨이트로까지 풀리면 모델 자체는 더 이상 방어선이 아니다. 나와 옆 사람이 같은 Qwen3.8 Max를 쓴다. 이때 차이가 나는 지점은 이 모델을 어떤 데이터에 물리고, 어떤 워크플로 안에 박고, 어떤 판단을 자동화하지 않고 남겨 두느냐다.

1인 SaaS 개발자라면 계산이 단순해진다. 대량 처리는 6달러짜리 오픈 모델에 넘기고, 민감 데이터는 다음 주 풀리는 가중치로 자체 호스팅하고, 아낀 비용은 고객 맥락을 모으는 데 쓴다. 모델값이 2달러대로 내려간 만큼 경쟁 우위는 모델 밖으로, 내가 쥔 데이터와 고객 문제로 이동한다.

참고