Google EmbeddingGemma 2 공개로 텍스트·이미지·음성·영상 검색을 휴대폰 안의 한 모델로 처리할 수 있게 됐습니다 | DAKER 커뮤니티

사진, 음성 메모, 영상, 코드를 서버 없이 기기 안에서 한꺼번에 검색하는 일이 한결 현실적인 선택지가 됐습니다. Google DeepMind가 10월 6일 공개한 EmbeddingGemma 2는 텍스트만 다루던 EmbeddingGemma를 코드·이미지·오디오·영상까지 넓혀 하나의 임베딩 공간에 담은 오픈 모델입니다. 파라미터는 7억4천만 개, 라이선스는 상업적 사용이 가능한 Apache 2.0입니다. 개인정보가 민감한 데이터로 검색이나 RAG를 만들어야 하는 팀, 대회에서 멀티모달 검색 기준선을 빠르게 세워야 하는 참가자에게 바로 쓸모가 있는 발표입니다.

휴대폰에서 글·사진·소리·영상 카드가 하나의 벡터 공간으로 모이는 만화풍 설명용 생성 이미지
설명용 생성 이미지입니다.

무엇이 달라졌나

Google 공식 블로그에 따르면 1세대 EmbeddingGemma는 2천만 회 넘게 내려받았고, 주로 온디바이스 검색과 개인정보 중심 RAG 파이프라인에 쓰였습니다. 2세대는 Gemma 4 구조 위에 만들어졌고 Gemini Embedding 모델과 같은 기술을 바탕으로 합니다. Google은 음성 메모로 특정 영상 클립을 찾거나, 텍스트 질의 하나로 몇 시간 분량의 녹음을 검색하는 일을 하나의 네이티브 멀티모달 모델로 처리할 수 있다고 설명합니다. 주요 특징은 다음과 같습니다.

텍스트 기능은 작게 시작하고 이미지와 오디오가 필요할 때만 인코더를 더하는 구조라서, 기기 사양에 맞춰 모델 크기를 고를 수 있습니다.

성능은 어떻게 읽어야 하나

공식 발표가 앞세운 수치는 코드 검색입니다. MTEB Code 점수가 68.76에서 78.68로 9.92점 올랐고, 다국어 텍스트 성능은 1세대 수준을 유지한다고 설명합니다. 10억 파라미터 미만 멀티모달 임베딩 모델 가운데 MTEB Code와 오디오 벤치마크 MAEB에서 선두권 점수를 냈으며, 일부 영역에서는 두 배 이상 큰 전문 모델보다 낫다고 적었습니다. 세부 지표는 모델 카드에 정리되어 있다고 안내하므로, 한국어 검색 품질처럼 자기 과제에 중요한 항목은 직접 확인해 보는 것이 안전합니다.

어디에 바로 써 볼 수 있나

Google은 활용 예로 텍스트나 이미지로 미디어 라이브러리를 찾는 검색, 텍스트·음성으로 영상 속 특정 장면을 찾는 기능, Gemma 4와 짝을 지은 로컬 파일 RAG를 들었습니다. EmbeddingGemma 2는 Gemma 4와 텍스트 토크나이저 및 오디오 인코더를 공유하므로, 두 모델을 한 파이프라인에서 함께 돌려도 전체 메모리 사용량을 줄일 수 있다고 합니다.

가중치는 Hugging Face와 Kaggle에서 받을 수 있고, transformers, sentence-transformers, vLLM, llama.cpp, Ollama 같은 익숙한 도구로 서빙할 수 있습니다. 미세조정은 Unsloth 가이드가, 벡터 저장은 Qdrant 연동이 안내되어 있습니다. Gemini Enterprise Agent Platform의 Model Garden 제공은 곧 시작될 예정입니다.

배포 경로도 다양합니다. 기기 안에서 바로 쓰려면 Google AI Edge의 MediaPipe로 임베딩·검색·의사결정 작업을 구성하거나, LiteRT로 직접 모델을 통합할 수 있습니다. 브라우저에서는 transformers.js나 WebGPU로 돌릴 수 있습니다. MediaPipe Decision Task API를 쓰면 멀티모달 맥락을 바탕으로 분류, 라우팅, 예측을 하는 실시간 판단 엔진도 만들 수 있다고 소개했습니다. Google AI Edge Gallery 앱의 Instant Media Search와 Video Moments Finder에서 미디어 검색과 영상 장면 찾기를 먼저 체험해 볼 수도 있습니다.

데이터 대회 참가자라면

멀티모달 검색이나 문서 질의응답 과제에서는 임베딩 기준선을 얼마나 빨리 세우느냐가 실험 속도를 좌우합니다. 처음에는 768차원으로 기준 점수를 잡고, 같은 평가 데이터에서 256차원과 128차원으로 줄였을 때 점수가 얼마나 떨어지는지 기록해 두면 저장 공간과 정확도 사이의 균형점을 숫자로 설명할 수 있습니다. 외부 사전학습 모델의 사용 범위는 대회마다 규정이 다르므로, 적용 전에 대회 규칙에서 허용 여부를 먼저 확인해야 합니다.

여러분은 임베딩 모델을 고를 때 정확도와 메모리 가운데 무엇을 먼저 보십니까? 한국어 데이터로 시험해 본 결과가 있다면 댓글로 나눠 주시면 좋겠습니다.

출처: Google 공식 블로그, EmbeddingGemma 2: an open, lightweight multimodal embedding model (2026년 10월 6일)