AX 패턴2026-10-05

토큰의 97.2%를 로컬에서

Google Antigravity SDK가 Gemma 4 로컬 실행과 클라우드 설계를 한 팀으로 묶는다

Google Antigravity SDK가 로컬 모델 실행을 지원한다. 클라우드 모델이 계획을 세우고 로컬 Gemma가 실행하는 구조에서 보안 점검 시연의 토큰 97.2%가 로컬에서 처리됐다. 필요 사양은 메모리 24GB 이상이다.

에이전트가 쓰는 토큰의 97.2%를 자기 컴퓨터에서 처리하면 API 청구서는 어떻게 되나. Google이 9월 23일 Antigravity SDK의 로컬 모델 지원을 발표하면서 내놓은 시연 수치다. 클라우드의 Gemini 3.8 Flash가 계획을 세우고 로컬의 Gemma 4 26B A4B가 실제 작업을 한 보안 점검 시연에서 나왔다.

한 줄 정리

계획은 비싼 클라우드 모델에 맡기고 반복 실행은 로컬 모델이 하는 분업이 SDK 기능으로 들어와, 에이전트 비용의 대부분을 API 밖으로 빼는 길이 열렸다.

한눈에 보기

발표 2026년 9월 23일
로컬 모델 Gemma 4 26B A4B (LiteRT로 실행)
연결 가능한 서버 Ollama, LM Studio, vLLM 등 OpenAI 호환 서버
권장 사양 VRAM 또는 통합 메모리 24GB 초과
시연 결과 보안 점검에서 전체 토큰의 97.2%를 로컬 처리
설치 pip으로 google-antigravity와 litert-lm

설계자와 시공자

시연은 건설 현장처럼 짠다. 클라우드 모델이 설계자로서 큰 그림과 작업 목록을 만들고, 로컬 모델이 시공자로서 파일 하나하나를 읽고 점검한다. 토큰이 많이 드는 쪽은 시공이다. 설계는 한 번이면 되지만 시공은 파일 수만큼 반복된다. 그 반복을 로컬로 돌리니 클라우드로 나가는 토큰이 3% 안쪽으로 줄었다.

같은 에이전트 구성과 도구를 로컬 백엔드를 바꿔 가며 그대로 쓸 수 있다는 점도 짚을 만하다. Ollama나 LM Studio로 돌리던 팀이 오케스트레이션 코드를 새로 짤 필요가 없다.

데이터도 밖으로 안 나간다. 고객 목록, 계약서, 미공개 원고처럼 클라우드에 올리기 꺼려지는 문서를 대량으로 훑는 작업에 어울린다. 완전한 오프라인 동작도 된다.

도입 전에 따져 볼 것

사양 문턱이 있다. 메모리 24GB 초과는 최근 맥북 프로나 게이밍 데스크톱 수준이다. 직원 전원의 노트북이 이를 넘는다고 가정할 수 없다. 팀에 그런 장비가 한두 대뿐이라면 공용 작업 머신 한 대를 두는 편이 낫다.

시연 수치는 보안 점검이라는 한 작업에서 나온 값이다. 카피 작성이나 영상 기획처럼 판단의 질이 결과를 좌우하는 일에서 로컬 모델이 같은 비율을 감당한다는 보장은 없다. 반복적이고 규칙이 분명한 일에 먼저 대 본다.

위시클레이 관점

97.2%라는 숫자는 모델 성능이 아니라 일의 모양을 말해 준다. 에이전트가 쓰는 토큰은 생각하는 데보다 읽고 훑는 데 대부분 쓰인다. 그리고 훑는 일은 똑똑한 모델이 아니어도 된다.

그래서 팀이 던질 질문이 바뀐다. 어떤 모델이 제일 좋은가가 아니라, 우리 업무 흐름에서 "한 번 판단하는 구간"과 "천 번 반복하는 구간"이 어디서 갈리는가다. 월 구독 하나로 전 직원이 같은 모델을 쓰는 방식에서는 이 구분이 필요 없었다. 에이전트가 일하는 순간부터 청구서가 이 구분을 요구한다.

콘텐츠 에이전시라면 후보 100개 헤드라인 중 상위 5개를 고르는 일은 클라우드에, 100개 전부를 브랜드 가이드와 대조하는 일은 로컬에 두는 식으로 가를 수 있다. 구분선을 어디에 긋는지가 곧 그 팀의 운영 노하우가 된다.

참고