기술 신호2026-08-08

중국 랩이 프런티어 값을 미국 수준까지 내렸다

Qwen3.8-Max 출력 100만 토큰 6달러, 오픈 가중치는 다음 주

알리바바가 2.4조 파라미터 MoE 모델을 입력 2달러·출력 6달러에 열었다. OSWorld 86.1로 미국 폐쇄 모델을 앞질렀고 오픈 가중치가 다음 주 예정이다. 값이 계속 내려가는 시장에서 1인 개발자의 셈법은 무엇인가.

알리바바가 8월 3일 Qwen3.8-Max를 API로 열었다. 파라미터 2.4조, 활성 950억의 mixture-of-experts 구조에 컨텍스트 100만 토큰, 텍스트·이미지·영상을 그대로 입력받는다. 가격은 입력 100만 토큰 2달러, 출력 6달러다. 벤치마크에서 OSWorld-Verified 86.1을 찍어 GPT-5.6 Sol Max(83.2)와 Gemini 3.1 Pro(76.2)를 앞섰고 Claude Fable 5(85.0)보다도 근소하게 높다. Artificial Analysis 지능 지수는 58로 비슷한 가격대 추론 모델 중앙값(33)을 크게 웃돈다.

숫자 자체보다 중요한 건 위치다. 지난 2년간 "프런티어급은 미국 폐쇄 모델, 싼 건 중국 오픈 모델"이라는 분업이 있었다. Qwen3.8-Max는 그 선을 지웠다. 최상위 성능을 미국 폐쇄 모델과 같은 값에 내놓았고 오픈 가중치까지 예고했다.

한눈에 보기

파라미터 / 활성 2.4조 / 950억 (MoE)
컨텍스트 100만 토큰
가격 (입력/출력, 100만 토큰) 2달러 / 6달러
OSWorld-Verified 86.1 (GPT-5.6 Sol Max 83.2, Claude Fable 5 85.0)
오픈 가중치 다음 주(8월 10일 주) 예정, 라이선스 미공개

가격이 성능과 분리되기 시작했다

작년까지 "더 똑똑한 모델 = 더 비싼 모델"은 대체로 맞았다. Qwen3.8-Max는 그 상관을 흔든다. 출력 6달러는 프런티어 성능치고 낮은 값이다. 같은 급으로 묶이는 미국 모델들이 출력 토큰에 두 자릿수 달러를 매기던 것과 비교하면 더 그렇다.

이건 알리바바 혼자만의 움직임이 아니다. 같은 주에 DeepSeek-V4-Flash, Kimi K3 같은 저가 고성능 모델이 줄줄이 나왔다. 공급이 늘면 값이 내려간다는 오래된 법칙이 토큰 시장에서도 작동하고 있다. 프런티어를 쓰던 팀이 이제 요금 걱정 없이 프런티어를 상시로 돌릴 수 있는 구간에 들어섰다.

오픈 가중치의 약속과 현실

알리바바는 Qwen3.8-Max와 더 작은 Qwen3.8-27B의 가중치를 다음 주 공개하겠다고 했다. Max급 Qwen이 자가 호스팅 가능해지는 첫 사례다. 다만 냉정하게 보면 2.4조 모델은 워크스테이션에 얹을 물건이 아니다. 활성만 950억이라 서버 여러 대가 필요하다. 현실적으로 직접 돌릴 수 있는 건 27B 쪽이다.

라이선스도 아직 공개되지 않았다. Qwen 3.5와 3.6은 Apache 2.0으로 나왔지만 3.8-Max가 같은 조건일지는 확정된 바 없다. "오픈"이라는 단어와 "내 서버에서 상업적으로 자유롭게"라는 조건은 별개다. 발표를 곧이곧대로 받기 전에 라이선스 원문을 확인해야 한다.

위시클레이 관점

1인 SaaS 개발자에게 이 뉴스의 실전 지점은 "오픈 가중치가 나오니 자가 호스팅하자"가 아니다. 2.4조 모델을 직접 돌릴 GPU 예산은 우리에게 없고 필요도 없다. 진짜 신호는 값이다. 프런티어 출력이 6달러까지 내려왔고 경쟁자가 같은 주에 셋이나 더 나왔다면 앞으로 몇 달 안에 더 내려간다는 뜻이다.

그러면 설계 원칙은 하나로 좁혀진다. 특정 모델에 코드를 못 박지 마라. 오늘 Qwen3.8-Max가 OSWorld에서 앞서도 3주 뒤엔 다른 이름이 그 자리에 온다. 프롬프트·평가셋·라우팅 계층을 모델과 분리해 두면 값이 내려갈 때마다 싼 쪽으로 갈아타고 성능이 뛸 때마다 좋은 쪽으로 붙일 수 있다. 자가 호스팅으로 락인을 피하는 게 아니라 교체 비용을 0에 가깝게 만들어 락인을 피하는 것이다. 27B 오픈 가중치가 의미 있는 경우도 여기 있다. 분류·요약처럼 프런티어가 아까운 작업을 로컬 27B로 내리고 판단이 필요한 지점만 최상위 API로 보내면 청구서와 지연을 동시에 줄인다.

참고