27B 모델이 5.9GB로 줄었고 벤치마크 98.2%가 남았다
노트북에 들어간 Qwen3.8
PrismML이 Qwen3.8 27B를 5.9GB로 압축한 Bonsai 2 27B를 공개했다. 20개 벤치마크 종합 83.9로 원본 85.4의 98.2%다. 라이선스는 Apache 2.0이고 컨텍스트는 262K다.
270억 파라미터짜리 모델이 5.9GB 파일 하나가 됐다. PrismML이 9월 17일 공개한 Bonsai 2 27B는 Qwen3.8 27B를 그대로 압축한 모델이다. 원본 대비 9분의 1 크기이고 20개 벤치마크 종합 점수는 83.9로 원본 85.4의 98.2%가 남았다.
방식은 삼진 양자화다. 모든 가중치를 -1, 0, +1 세 값 중 하나로 매핑하고 128개씩 묶어 FP16 스케일 값 하나를 공유한다. 그래서 가중치당 유효 비트가 1.76비트로 떨어진다. 부호만 남기되 묶음 단위로 크기를 되살리는 구조다.
라이선스는 Apache 2.0, 컨텍스트 창은 262K 토큰, 입력은 텍스트와 이미지 둘 다 받는다. NVIDIA RTX 5090에서 초당 143토큰까지 나온다.
한 줄 정리
27B급 멀티모달 모델을 5.9GB로 줄이고도 종합 성능 98.2%를 유지한 가중치가 Apache 2.0으로 풀렸다.
한눈에 보기
| Qwen3.8 27B (원본) | Bonsai 2 27B | |
|---|---|---|
| 크기 | 약 9배 | 5.9GB |
| 가중치 표현 | 원본 정밀도 | 삼진 {-1, 0, +1} + 128개 묶음 FP16 스케일 |
| 유효 비트/가중치 | 1.76 | |
| 20개 벤치마크 종합 | 85.4 | 83.9 (98.2%) |
| 컨텍스트 | 262K | |
| 입력 | 텍스트 + 이미지 | |
| 라이선스 | Apache 2.0 | |
| 처리 속도 | RTX 5090 기준 143 tok/s |
98.2%가 가리는 것
종합 점수는 추론, 수학, 코딩, 지시 이행, 비전, 에이전트형 도구 호출까지 스무 묶음을 평균 낸 값이다. 평균이 98.2%라는 말은 어떤 항목은 그보다 잘 버텼고 어떤 항목은 더 떨어졌다는 뜻이기도 하다.
압축 모델을 실제로 붙여 보면 손실이 고르게 퍼지지 않는다. 긴 체인으로 이어지는 추론이나 형식을 정확히 지켜야 하는 출력에서 먼저 흔들리는 경우가 많다. 반대로 분류, 요약, 태깅처럼 판단 폭이 좁은 작업은 거의 차이를 못 느낀다.
그러니 발표 숫자로 결정을 끝내지 말고 팀에서 제일 자주 돌리는 작업 서른 건을 뽑아 같은 프롬프트로 원본과 나란히 돌려 보는 편이 낫다. 반나절이면 끝나고 벤치마크 표보다 정확하다.
5.9GB가 바꾸는 계산
파일 하나가 5.9GB면 RAM 16GB짜리 노트북에서 돈다. 이 숫자가 세 가지를 동시에 건드린다.
첫째, 청구서가 사라진다. 토큰 단가가 아니라 전기값이 든다. 분류나 태깅처럼 호출 수가 많고 건당 가치가 낮은 작업을 API로 돌리면 자릿수가 커지는데 그 구간이 통째로 로컬로 내려온다.
둘째, 데이터가 안 나간다. 상담 로그, 인사 기록, 아직 계약 전인 견적서를 외부 API에 붙이기 망설였다면 그 망설임의 근거가 없어진다. 모델이 데이터가 있는 쪽으로 오면 데이터가 이동할 이유가 없다.
셋째, 라이선스가 걸림돌이 아니다. Apache 2.0이라 상업적 이용과 재배포가 열려 있다. 고객에게 납품하는 제품 안에 넣어도 되고 사내 도구로 박아도 된다. 262K 창이면 계약서 한 건이나 제품 매뉴얼 전체를 잘라 넣지 않고 통째로 올린다.
다만 143 tok/s는 RTX 5090 기준이다. 맥북에서는 훨씬 느리게 나온다. 대화형으로 쓸 생각이면 기대치를 낮추고, 배치 처리 쪽으로 붙이면 속도 차이가 덜 아프다.
작은 모델이 몰리는 자리
허깅페이스 쪽 공개 지표를 보면 이 계열 파일의 다운로드가 150만 건을 넘겼다. 같은 목록에 GGUF 양자화본들이 나란히 올라와 있다. 판 전체가 한쪽으로 기울고 있다는 신호로 읽힌다.
프런티어 모델 경쟁이 매달 갱신되는 동안 다른 쪽에서는 "이미 충분히 좋은 모델을 얼마나 작게 만드느냐"가 별도 경기가 됐다. 이쪽 경기의 승부처는 벤치마크 1위가 아니라 실행 위치다. 노트북, 사무실 미니PC, 매장 단말기에서 도느냐 마느냐.
위시클레이 관점
5.9GB는 USB 메모리에 담긴다. 이 숫자가 바꾸는 건 성능 순위표가 아니라 어떤 데이터를 모델에게 보여 줄 수 있느냐다.
컨설팅을 하다 보면 자동화가 막히는 지점이 대개 똑같다. 기술이 아니라 "이 파일은 외부로 못 보냅니다"에서 멈춘다. 상담 녹취, 계약 직전 견적, 직원 평가 메모. 정작 AI를 붙였을 때 효과가 가장 큰 데이터가 전부 그 칸에 들어 있다. 5.9GB짜리 가중치 파일과 Apache 2.0 조합은 그 칸을 연다.
그러면서 같은 조합이 새 일도 만든다. 클라우드 API를 쓸 때는 업데이트와 운영을 남이 했다. 로컬로 내리는 순간 어느 버전이 어느 기계에서 도는지를 누군가 관리한다. 회사 노트북 다섯 대에 각자 다른 파일이 깔려 있고 누구 것이 최신인지 아무도 모르는 상태가 제일 나쁘다. 모델 파일을 사내 공유 위치 한 곳에 두고 거기서만 배포하는 정도의 규칙이면 대개 충분하다.
붙일 자리를 고르는 기준도 하나 있다. 결과가 틀렸을 때 사람이 바로 알아채는 작업부터 내리는 쪽이 안전하다. 태깅, 분류, 1차 초안, 회의록 정리가 그런 부류다. 반대로 결과가 그대로 고객에게 나가는 자리는 나중에 옮긴다.
그래서 이 뉴스의 실행 항목은 "로컬 모델로 갈아탄다"가 아니다. 지금 API로 보내는 작업 목록을 펴 놓고 밖으로 안 보내도 되는 것과 보낼 수 없어서 아예 자동화를 포기한 것을 나누는 일이다. 두 번째 칸이 이번에 열렸다.