740M 파라미터 하나로 글·사진·영상·음성을 한 번에 검색한다
EmbeddingGemma 2는 Apache 2.0, 텍스트만 쓰면 191MB
Google이 공개한 EmbeddingGemma 2는 텍스트, 이미지, 영상, 오디오를 한 벡터 공간에 넣는 오픈 모델이다. 라이선스는 Apache 2.0이고 텍스트 전용은 Pixel 11 Pro에서 약 191MB RAM을 쓴다. 고객 자료를 밖으로 내보내지 않는 사내 검색이 가능해진다.
Google이 10월 6일 EmbeddingGemma 2를 내놨다. 글, 이미지, 영상 프레임, 오디오를 768차원 벡터 하나로 바꿔 같은 공간에서 찾는 오픈 가중치 모델이다. 전체 파라미터는 약 7억 4천만이고 텍스트만 쓰면 Pixel 11 Pro 기준 활성 메모리 191MB, 멀티모달 전체는 567MB가 든다. 라이선스는 Apache 2.0.
한 줄 정리
사진·녹음·영상·문서가 뒤섞인 팀 자료를 클라우드로 보내지 않고 노트북이나 폰에서 한 번에 검색하는 길이 무료 라이선스로 열렸다.
한눈에 보기
| 전체 크기 | 약 7억 4천만 파라미터 (텍스트 2.7억, 비전 1.7억, 오디오 3억) |
| 입력 | 텍스트, 이미지, 영상, 오디오 (인코더 선택 로딩) |
| 출력 | 768차원, 512·256·128로 축소 가능 |
| 컨텍스트 | 8,192 토큰 (전 모달리티 공유) |
| 언어 | 100개 이상 |
| 메모리 | 텍스트만 약 191MB, 전체 약 567MB (Pixel 11 Pro) |
| 속도 | 이미지 임베딩 37.3ms (MacBook M5 Pro GPU) |
| 성능 | MTEB 다국어 v2 평균 61.36, 코드 NDCG@10 78.68 |
| 라이선스 | Apache 2.0 |
왜 팀에 쓸모가 있나
임베딩 모델은 검색의 바닥 부품이다. 질문과 문서를 숫자 벡터로 바꿔 가까운 것을 찾는다. 지금까지 사내 자료 검색을 만들려면 글은 글 모델로, 사진은 이미지 모델로 따로 벡터를 만들고 두 인덱스를 이었다. EmbeddingGemma 2는 한 공간이라 "작년 가을 팝업 행사 현장 사진"이라는 문장으로 사진과 영상과 회의 녹음을 같이 찾는다.
콘텐츠·미디어 팀의 현실에 맞는다. 촬영 원본, 인터뷰 녹음, 기획서, 고객사 피드백 메일이 폴더 여기저기 흩어져 있다. 파일명 규칙으로 버티는 팀은 많고 규칙이 지켜지는 팀은 드물다. 벡터 검색은 규칙이 무너진 뒤에도 일한다.
바깥으로 안 나간다는 점도 크다. 고객사 미공개 시안이나 인터뷰 원본을 외부 API로 임베딩하려면 계약서부터 읽어야 한다. 기기 안에서 돌면 그 단계가 사라진다. Google이 시연한 Mac용 회의 노트 검색 앱도 같은 방향이다.
저장 비용을 줄이는 방법
Matryoshka 방식으로 768차원을 128~512로 잘라 쓸 수 있다. Google은 인덱스 크기를 최대 8배까지 줄일 수 있다고 설명한다. 모델 카드 기준으로 256차원은 MTEB 다국어 점수가 60.41로 거의 유지되고 128차원은 57.89로 떨어진다. 128차원은 텍스트 전용에 맞는다고 적혀 있다.
알아둘 제약이 몇 가지 있다. 입력 앞에 task: search result | query: 같은 접두어를 붙여야 품질이 나온다. float16은 쓰지 말라고 명시돼 있다. 벡터를 자른 뒤에는 다시 정규화하고 질의와 문서의 차원을 맞춰야 한다. 이미지 한 장은 약 280토큰, 오디오는 초당 약 25토큰으로 계산된다.
위시클레이 관점
파라미터 7억은 요즘 기준으로 작다. 191MB는 사진 두세 장 용량이다. 크기가 작아졌다는 사실보다 중요한 건 Apache 2.0이 붙었다는 점이다. 상업 서비스에 넣고 고객에게 팔아도 되고 수정해서 배포해도 된다.
에이전시에게 이건 상품이 될 수 있다. 고객사마다 폴더 하나를 임베딩해서 "우리 브랜드 톤에 맞는 과거 시안 찾기"를 사내 도구로 납품하는 일이다. 고객 입장에서 데이터가 자기 서버를 안 떠난다는 문장은 설명 한 줄로 계약 단계를 줄인다. 같은 모델은 모두가 쓸 수 있으니 차별은 어떤 자료를 어떤 단위로 쪼개 넣느냐에서 난다. 시안을 한 장씩 넣을지, 캠페인 단위로 묶을지에 따라 검색 결과가 달라진다.
반대로 이 모델이 풀어 주지 않는 것이 있다. 검색은 찾아 줄 뿐 무엇이 좋은 시안인지는 말해 주지 않는다. 벤치마크 숫자도 영어와 일반 도메인 중심이라 한국어 광고 카피나 업계 용어에서 얼마나 나오는지는 직접 재 봐야 한다. 팀 자료 100건으로 질문 20개를 만들어 정답이 상위 5개에 드는지 보면 반나절에 끝난다.
혼자 일하는 영상 크리에이터라면 수년간 쌓은 촬영 소스를 노트북에서 문장으로 찾는 정도로 시작할 수 있다. 서버 비용이 없다.