기술 신호2026-09-16

출력 토큰 값을 0으로 매긴 모델이 나왔다

문자열을 포기하니 444배가 싸졌다

TypeSafe AI가 9월 14일 Jev를 얼리 액세스로 공개했다. 글을 쓰는 대신 미리 정한 타입의 값과 확률만 내놓는다. 입력 100만 토큰에 0.042달러, 출력은 무료다.

가격표에 출력 토큰 값이 "무료(과금하기엔 너무 쌈)"라고 적혀 있다. TypeSafe AI가 9월 14일 공개한 Jev 이야기다. 입력은 100만 토큰에 0.042달러. 프런티어 모델의 입력 단가가 100만 토큰에 0.20달러에서 10달러 사이고 출력은 보통 입력의 다섯 배쯤 받는다. 응답 시간도 70밀리초에서 500밀리초 구간이다. 이 회사는 2년간 스텔스로 있다가 4천만 달러를 들고 나왔고 창업자 디오고 알메이다는 OpenAI에서 지시 따르기 연구를 했던 사람이다.

한 줄 정리

Jev는 글을 생성하는 능력을 통째로 버리는 대신 분류·점수·분기 같은 결정만 확률과 함께 내놓고 값을 두 자릿수 배수로 깎았다.

한눈에 보기

기존 LLM Jev
출력 형태 문자열(파싱·검증 필요) 미리 정의한 타입의 값
샘플링 토큰 하나씩 순차 전부 한 질의에서 병렬
입력 단가 0.20~10달러 / 100만 토큰 0.042달러
출력 단가 입력의 약 5배 0
응답 시간 3~329초 70~500ms
타입 오류 발생함 0%(스키마 보장)

잘하는 걸 뺀 게 아니라 안 쓰던 걸 뺐다

Jev는 문장을 못 쓴다. 대신 개발자가 미리 적어 둔 선택지 안의 값 하나와 그 값에 대한 확률을 돌려준다. 고객 문의가 환불 요청인지 아닌지, 이 리드가 진짜인지 스팸인지, 이 글이 우리 톤에 맞는지. 답이 미리 정해진 칸 안에 들어가는 질문들이다.

이런 질문에 채팅 모델을 쓰면 모델은 토큰을 하나씩 순서대로 뱉고 우리 코드는 그 문자열을 다시 파싱한다. 파싱이 깨지면 재시도를 돌리고 그 재시도가 또 청구된다. Jev는 가능한 출력을 사전에 못 박아 두는 구조라 타입 오류가 나올 수 없다. 회사는 이걸 경험적 수치가 아니라 수학적으로 불가능하다고 적었다.

속도가 갈리는 지점도 같은 곳이다. 순차 생성 대신 모든 출력을 한 번의 질의에서 병렬로 뽑는다. 회사가 공개한 워크플로 평가에서는 193.6배 빠르고 444.6배 싸다는 숫자가 나왔다. 기준 답은 GPT-6 Astra와 Fable 5.1의 평균값을 썼다.

확률을 준다는 게 자동화에서 제일 큰 변화다

지금까지 자동화가 막힌 자리는 정확도가 아니었다. 95%를 맞히는 모델이 나머지 5%가 언제인지 말해 주지 않으면 그 작업은 자동으로 못 넘긴다. 결국 사람이 100%를 다시 본다. 정확도를 높이는 투자가 자동화율로 안 이어지던 이유가 여기 있다.

Jev는 모든 출력에 보정된 확률을 붙인다. 신뢰도가 높을수록 실제로 더 자주 맞는다는 뜻이다. 그러면 경계선을 숫자로 그을 수 있다. 0.9 위는 자동 처리, 아래는 사람 확인함으로. 이 선을 어디에 긋느냐가 팀의 판단이 되고 모델 성능은 그 선의 위치만 바꾼다.

데모 하나가 비용 감각을 잘 보여 준다. 이 회사 엔지니어가 초당 10회씩 모델을 불러 둠(Doom)을 플레이하게 만들었는데 시간당 7달러쯤 든다. 초당 10회 호출을 값 걱정 없이 돌린다는 게 채팅 모델 가격표에서는 성립하지 않는 문장이다.

아직 못 쓴다

Jev는 얼리 액세스고 대기 명단을 받는 중이다. 카디널리티는 255까지 지원한다. 선택지가 그보다 많으면 점수를 먼저 매기고 고르는 2단계를 거친다. 벤치마크도 회사가 자기 팀에서 만든 워크플로 네 개로 재서 공개했고 편향 가능성을 스스로 적어 뒀다.

값이 싼 이유가 보조금인지도 아직 모른다. 회사는 이를 증명할 수 없다고 인정하면서 가격이 내려가지 올라가진 않을 거라고 적었다. 모델 이름 Jev는 제번스에서 왔다. 석탄이 그랬듯 지능 값이 한 자릿수 떨어질 때마다 수요가 그보다 크게 는다는 쪽에 건 이름이다.

위시클레이 관점

지난달 API 청구서를 열어 호출을 두 무더기로 나눠 보면 이 발표가 무슨 뜻인지 바로 나온다. 한쪽은 글을 쓰게 한 호출이다. 초안, 요약, 답장. 다른 쪽은 결정만 시킨 호출이다. 문의 분류, 스팸 판정, 태깅, 우선순위 점수. 대부분의 팀은 두 번째 무더기가 건수로 훨씬 많고 그 전부를 첫 번째 무더기와 같은 단가로 내고 있다.

출력 토큰이 무료인 가격표는 그 두 무더기를 갈라놓으라는 신호다. 열 단어짜리 판정을 받으려고 100만 토큰에 10달러짜리 모델을 부르는 습관은 편의지 설계가 아니었다. 결정 한 건에 70밀리초가 걸린다면 화면이 뜨는 동안에도 부를 수 있고 지금까지 배치로 미뤄 두던 작업이 실시간으로 내려온다.

당장 계약할 일은 아니다. 얼리 액세스라 줄을 서야 하고 검증도 만든 쪽 자료뿐이다. 지금 할 수 있는 건 준비다. 우리 업무에서 "예/아니오" 또는 "셋 중 하나"로 끝나는 판단을 목록으로 적어 두면 된다. 그 목록이 길수록 이 가격표가 도착했을 때 얻는 게 크고, 짧다면 애초에 남의 얘기다.

한 가지는 지금도 옮겨 올 수 있다. 확률로 경계선을 긋는 방식이다. 지금 쓰는 모델에도 판정과 함께 확신도를 같이 받아 두고 낮은 건만 사람이 보는 구조로 바꿔 두면, 나중에 모델을 갈아 끼울 때 바뀌는 건 호출 한 줄뿐이다.

참고