Skip to content
Neuronavt
Go back

EmbeddingGemma 2: мультимодальные векторы на устройстве

Инструмент7/10

Коротко

Google представила компактную модель для создания эмбеддингов текста, кода, изображений, видео и аудио в общем пространстве. Она рассчитана на локальный поиск и RAG, а уменьшение размерности векторов и заявленная работа при умеренном расходе памяти могут быть полезны для приложений на устройствах.

Контекст

Автор — Google, представляющая EmbeddingGemma 2 как развитие EmbeddingGemma, которую, по заявлению компании, скачали более 20 миллионов раз. Задача — дать разработчикам единую компактную модель для мультимодального поиска и извлечения данных, в том числе офлайн и с локальной обработкой ради приватности.

Главное

Как сделано

EmbeddingGemma 2 построена на архитектуре Gemma 4, имеет 740 млн параметров и распространяется по лицензии Apache 2.0. Для текстовых задач можно использовать конфигурацию на 270 млн параметров; для мультимодальности подключаются отдельные энкодеры зрения (170 млн) и аудио (300 млн). Модель формирует эмбеддинги для текста, кода, изображений, видео и аудио в общем пространстве.

Matryoshka Representation Learning позволяет сокращать размер выходных векторов с 768 до 512, 256 или 128 измерений. Контекстное окно — 8K токенов. Google указывает поддержку запуска через MediaPipe и LiteRT, а также браузерных решений transformers.js и WebGPU; для серверного и локального развёртывания перечислены transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio. В качестве хранилища векторов назван Qdrant.

Результаты

Google сообщает о ведущих результатах среди мультимодальных моделей-эмбеддеров с менее чем 1 млрд параметров на бенчмарках MTEB Code и MAEB; по словам компании, модель сопоставима с некоторыми более крупными решениями или превосходит их в задачах текста, зрения и аудио. В MTEB Code результат вырос с 68,76 у EmbeddingGemma до 78,68 — на 9,92 пункта. Уменьшение вектора с 768 до 128 измерений, по заявлению Google, даёт до 6-кратного сокращения хранилища и памяти векторной базы. После квантования на Google Pixel 11 Pro указано около 191 МБ активной RAM для текстового варианта и около 567 МБ для полной мультимодальной модели. Окно 8K токенов, согласно статье, позволяет обрабатывать до 5,5 минуты аудио, 29 изображений или 58 видеокадров.

Ограничения

Материал — анонс Google, а не независимая оценка: подробные метрики отсылают к карточке модели, но в статье не приведены таблицы бенчмарков и протоколы сравнения. Показатели памяти зависят от квантования и конфигурации; заявленные значения для Pixel 11 Pro нельзя автоматически переносить на другие устройства. Не описаны фактические задержки, энергопотребление, качество на конкретных пользовательских данных и затраты на внедрение.

Что взять себе

Читать оригинал, если…

Откройте оригинал и карточку модели, если нужны полные таблицы бенчмарков, веса, инструкции по развёртыванию и настройке или примеры интеграции с LiteRT.