구글, 0.5GB RAM 온디바이스 구동 멀티모달 임베딩 모델 'EmbeddingGemma 2' 오픈소스 공개

구글 딥마인드가 텍스트·코드·이미지·오디오·비디오를 768차원 단일 벡터 공간으로 매핑하는 740M 경량 온디바이스 임베딩 모델 'EmbeddingGemma 2'를 아파치 2.0 라이선스로 공개했습니다.

tau · 2026년 10월 7일

#Google #DeepMind #EmbeddingGemma #임베딩 #온디바이스AI #Gemma

구글, 0.5GB RAM 온디바이스 구동 멀티모달 임베딩 모델 'EmbeddingGemma 2' 오픈소스 공개

구글 딥마인드(Google DeepMind)가 2026년 10월 6일, 텍스트와 코드는 물론 이미지, 오디오, 비디오를 768차원 단일 벡터 공간으로 통합 매핑하는 오픈소스 멀티모달 임베딩 모델 'EmbeddingGemma 2'를 공식 공개했습니다. 아파치 2.0(Apache 2.0) 라이선스로 배포된 이번 모델은 총 740M 파라미터 규모로, 스마트폰과 노트북 등 온디바이스 환경에서 클라우드 연결 없이 로컬 RAG와 시맨틱 검색을 즉시 수행할 수 있도록 설계되었습니다.

구글 딥마인드 EmbeddingGemma 2 멀티모달 임베딩 아키텍처 개요

이미지 출처: Google DeepMind

기존 대다수의 임베딩 모델이 텍스트 검색에 국한되거나 멀티모달 처리를 위해 대규모 VRAM을 장착한 클라우드 서버 클러스터에 의존했던 것과 달리, EmbeddingGemma 2는 1B 미만의 컴팩트한 모듈형 설계를 바탕으로 온디바이스 엣지 AI 환경에 최적화된 것이 핵심입니다.

768차원 단일 벡터 공간과 740M 모듈형 인코더 아키텍처

EmbeddingGemma 2의 기술적 핵심은 서로 다른 미디어 모달리티를 개별 분리하지 않고, 동일한 768차원 임베딩 공간 안에서 정렬한다는 점입니다.

Gemma 4 디코더 아키텍처를 기반으로 구축된 이 모델은 총 740M 파라미터를 유연한 모듈형 구조로 분할하여 구성했습니다.

  • 텍스트 및 코드 기본 모델 (270M): 130M 파라미터의 백본(Backbone)과 140M 파라미터의 임베더(Embedder)로 구성되어 텍스트와 소스 코드 임베딩을 전담합니다.
  • 비전 인코더 (170M): 정지 이미지와 동영상 프레임 데이터를 768차원 벡터로 변환합니다.
  • 오디오 인코더 (300M): 음성 녹음과 다양한 사운드 파형 데이터를 텍스트 및 시각 벡터와 동일한 좌표계로 투영합니다.

이러한 통합 아키텍처 덕분에 교차 모달리티(Cross-modal) 검색이 단일 모델 내에서 자연스럽게 작동합니다. 예를 들어 사용자가 녹음한 음성 메모로 특정 영상 클립의 장면을 검색하거나, 텍스트 질의어를 입력해 수 시간 분량의 오디오 녹음 파일에서 원하는 구간을 찾아내는 작업이 가능합니다.

0.5GB RAM 온디바이스 구동과 프라이버시 중심 오프라인 RAG

EmbeddingGemma 2는 일반 소비자용 스마트폰, 태블릿, 경량 랩톱의 CPU 및 내장 NPU 환경에서도 지연 시간 없이 작동하도록 하드웨어 풋프린트를 최소화했습니다.

텍스트 단독 모드로 구동할 경우 약 0.5GB 수준의 RAM 환경에서도 구동이 가능하며, 양자화 방식(bfloat16 또는 GGUF)에 따라 191MB 전후의 극소 메모리 점유율로 구동 환경을 압축할 수 있습니다. 이를 통해 고성능 외장 GPU나 네트워크 연결 없이도 다음과 같은 엣지 애플리케이션을 구현할 수 있습니다.

  • 완전 오프라인 RAG(검색 증강 생성): 기기 내부의 로컬 문서, 개인 메모, 소스 코드 저장소를 외부 서버 전송 없이 안전하게 인덱싱하고 검색합니다.
  • 로컬 시맨틱 검색 및 클러스터링: 네트워크 차단 환경에서도 디바이스에 저장된 사진, 오디오, 텍스트 파일을 의미 기반으로 분류하고 자동 태깅합니다.
  • 엔드투엔드 프라이버시 보호: 의료 기록이나 사내 기밀 코드 등 민감한 개인정보를 외부 API로 유출하지 않고 온디바이스 상에서 완결 처리합니다.

아파치 2.0 라이선스와 프레임워크 연동 주의점

구글 딥마인드는 EmbeddingGemma 2를 허용적인 아파치 2.0 라이선스로 공개하여 상용 서비스 및 사내 엔터프라이즈 환경에서의 자유로운 도입을 지원합니다.

모델 가중치는 허깅페이스(google/embeddinggemma-2)를 통해 공식 배포되었으며, 런칭 시점부터 Sentence Transformers와 Unsloth 라이브러리를 통한 GGUF 양자화 서빙을 지원합니다. 다만 현장 도입 시 메모리 최적화를 위해 확인해야 할 주요 엔지니어링 유의사항이 존재합니다.

  • 기본 로딩 동작: Sentence Transformers 등 표준 라이브러리에서 기본 설정으로 로드할 경우 비전 및 오디오 인코더를 포함한 740M 전체 파라미터가 메모리에 할당됩니다.
  • 텍스트 전용 메모리 최적화: 텍스트 및 코드 임베딩만 사용하는 환경이라면 config_kwargs={"vision_config": None, "audio_config": None} 설정을 전달하여 비전과 오디오 모듈 로딩을 건너뛰어야 270M 파라미터(약 0.5GB RAM)의 초경량 프로필을 온전히 확보할 수 있습니다.
  • 하드웨어별 성능 편차: 실제 작동 메모리 소비량과 인덱싱 지연 시간은 사용하는 양자화 포맷(bfloat16, GGUF) 및 실행 디바이스의 CPU/NPU 캐시 대역폭에 따라 차이가 발생할 수 있습니다.

출처