기술 신호2026-09-24

1시간 내레이션 원가가 0.81달러로 내려왔다

Gemini 3.8 TTS가 목소리 2,000개를 깔았다

구글이 9월 23일 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 냈다. 오디오 출력 100만 토큰 9달러, 과금은 초당 25토큰이다. 1시간 오디오가 0.81달러다. 전작은 같은 자리에 20달러였다.

1시간짜리 내레이션을 기계로 뽑는 값이 0.81달러다.

구글이 9월 23일 공개한 Gemini 3.8 Flash TTS는 오디오 출력 100만 토큰에 9달러를 매긴다. 과금 단위가 초당 25토큰이라 1시간 오디오는 9만 토큰이고 곱하면 0.81달러가 나온다. 같은 자리에 전작 3.1 Flash TTS는 20달러가 붙어 있었다. 1시간 기준 1.80달러에서 0.81달러로 내려왔다.

한 줄 정리

구글이 프롬프트로 목소리를 설계하고 30초 샘플로 복제하는 TTS 모델 두 종을 내면서 오디오 요율을 전작의 절반 아래로 낮췄다.

한눈에 보기

항목 3.1 Flash TTS 3.8 Flash TTS
오디오 출력 100만 토큰 20달러 9달러 (2027-01-01부터 18달러)
텍스트 입력 100만 토큰 해당 없음 0.50달러 (2027-01-01부터 1달러)
1시간 오디오 환산 1.80달러 0.81달러
바로 쓰는 음성 30개 2,000개 이상

같은 날 나온 Flash-Lite TTS는 언어 목록이 짧은 대신 요율이 더 낮은 라인이다. 구글은 이쪽을 대량 더빙과 음성 에이전트 용도로 못 박았다. 두 요율 모두 2026년 말까지의 값이고 해가 바뀌면 올라간다. 지금 잡는 숫자가 계속 가는 숫자는 아니다.

목소리를 고르는 일에서 만드는 일로 넘어갔다

전작에서 쓸 수 있던 프리셋은 30개였다. 3.8에서는 그 자리에 2,000개 이상의 완성된 음성이 들어왔고 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 같은 지역 변종까지 들어 있다. 언어는 100개 이상을 받는다.

더 큰 변화는 목록 밖에 있다. 자연어 프롬프트로 역할, 억양, 음색을 적어 새 목소리를 만들 수 있고 만든 목소리를 저장해 프로젝트 내내 같은 톤으로 재사용한다. 줄 단위 연출도 열렸다. 대본에 지문을 적어 속도와 감정을 지정하고 <laughs> <sigh> 같은 비언어 신호와 |mhm| 류의 맞장구까지 끼워 넣는다. 2인 대화 장면을 대본 하나로 찍어 내는 것도 모델이 직접 받는다.

품질 지표로는 Hume AI의 Voice Design Benchmark에서 71.4로 1위, 억양 모델링에서 60.8로 1위를 가져갔다. Overall Quality Index에서는 Flash와 Flash-Lite가 나란히 1위와 2위다.

값이 내려가면 원가표의 다른 칸이 커진다

숫자를 실무 단위로 바꿔 보면 감이 잡힌다. 10분짜리 유튜브 영상의 내레이션은 오디오 1만 5,000토큰 안팎이라 0.14달러 수준이다. 20편을 만들어도 3달러를 넘지 않는다. 같은 분량을 성우에게 맡기면 한국 시장 기준으로 편당 수만 원에서 수십만 원이 오간다.

그렇다고 제작 시간이 같은 비율로 줄지는 않는다. 값이 붙어 있던 자리가 비면 그 앞뒤 공정이 드러난다. 대본을 쓰고 고치는 시간, 발음이 틀린 고유명사를 잡는 시간, 여러 편에 걸쳐 같은 톤을 유지하는 관리, 그리고 나간 오디오를 다시 손봐야 할 때의 재작업이다. 저장한 커스텀 음성을 프로젝트 내내 재사용하는 기능이 들어온 것도 이 관리 비용을 겨냥한 쪽이다.

한 가지는 바로 써먹을 수 있다. 여러 번 고쳐야 하는 오디오일수록 기계 쪽의 이점이 커진다. 수정 한 번에 다시 녹음을 잡아야 하던 구조가 대본 한 줄 고치고 다시 돌리는 구조로 바뀐다. 제품 설명 영상이나 교육 콘텐츠처럼 내용이 자주 바뀌는 쪽이 먼저 갈아탈 자리다.

값보다 먼저 걸리는 것은 권리다

음성 복제는 30초 샘플이면 된다. 대신 조건이 붙는다. 목소리 주인이 직접 읽은 동의 녹음이 있어야 하고 그 녹음의 화자가 레퍼런스 음성과 일치해야 복제가 만들어진다. 출력물 전체에는 SynthID 워터마크가 들어가고 C2PA 자격 정보가 함께 붙는다.

지역 제한도 있다. AI Studio의 음성 복제는 일리노이, 텍사스, 유럽경제지역, 영국, 스위스, 인도에서 쓸 수 없다. 초상과 음성을 다루는 법이 센 곳들이다. 요금표를 보고 기획을 짰다가 배포 지역에서 막히는 순서가 나온다.

이미 어디에 실려 있나

개발자는 Gemini API와 Google AI Studio로 바로 접근한다. 일반 사용자 쪽에서는 Flash TTS가 Gemini Notebook에, Flash-Lite TTS가 Google Vids에 들어갔다. 기업용 Gemini Enterprise는 예정이다. Agora, LiveKit, Pipecat, Vercel 같은 플랫폼을 경유하는 경로도 첫날부터 열렸다.

파트너 명단에 Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang이 올라 있다. 더빙과 현지화, 음성 에이전트가 공통분모다. 값이 내려간 자리에서 무엇이 먼저 돌아가는지 보여 주는 명단이다.

위시클레이 관점

1시간 0.81달러라는 숫자는 목소리를 사는 비용을 사실상 0으로 만든다. 그러면 오디오 콘텐츠의 원가표에서 가장 큰 칸이 녹음비가 아니라 대본이 된다. 유튜브 채널을 돌리는 콘텐츠 팀이든 제품 설명 영상을 만드는 소규모 SaaS든, 다음 분기에 늘려야 하는 건 성우 예산이 아니라 대본을 쓰고 고치는 시간이다.

권리 쪽은 반대 방향으로 움직인다. 구글이 동의 녹음 검증과 SynthID를 기본으로 박아 둔 것, 그리고 음성 복제를 일리노이와 유럽경제지역에서 아예 잠근 것은 이 기능의 위험이 어디에 있는지 공급자가 먼저 인정한 표시다. 대표 목소리를 복제해 브랜드 보이스로 쓰겠다는 기획은 기술 검토가 아니라 계약서와 배포 지역 확인부터 시작하는 게 맞다. 특히 외주 성우의 기존 녹음분으로 목소리를 만들 생각이라면, 그 계약서에 음성 학습과 합성에 관한 문장이 없을 가능성이 높다.

워터마크는 양쪽으로 작동한다. 남이 내 목소리를 베낀 걸 잡아내는 데도 쓰이고, 내가 만든 오디오가 기계 산물이라는 사실이 계속 남는다는 뜻도 된다. 플랫폼이 생성물 표시 정책을 조이는 방향으로 가는 중이라 이 흔적은 지워지지 않는 전제로 두고 설계하는 편이 낫다.

참고