Коротко
Google представила компактную модель для создания эмбеддингов текста, кода, изображений, видео и аудио в общем пространстве. Она рассчитана на локальный поиск и RAG, а уменьшение размерности векторов и заявленная работа при умеренном расходе памяти могут быть полезны для приложений на устройствах.
Контекст
Автор — Google, представляющая EmbeddingGemma 2 как развитие EmbeddingGemma, которую, по заявлению компании, скачали более 20 миллионов раз. Задача — дать разработчикам единую компактную модель для мультимодального поиска и извлечения данных, в том числе офлайн и с локальной обработкой ради приватности.
Главное
- EmbeddingGemma 2 — мультимодальная модель на 740 млн параметров, построенная на Gemma 4 и выпущенная под Apache 2.0.
- Общее пространство эмбеддингов охватывает текст, код, изображения, видео и аудио; сценарии включают поиск видеоклипа по голосовой заметке и поиск по аудиозаписям текстовым запросом.
- Для текстовых задач предусмотрен вариант на 270 млн параметров; опциональные энкодеры зрения и аудио указаны как 170 млн и 300 млн параметров соответственно.
- Размерность вектора можно сокращать с 768 до 512, 256 или 128 с помощью Matryoshka Representation Learning; Google заявляет о снижении затрат на хранение до 6 раз.
- Окно контекста составляет 8K токенов — в четыре раза больше, чем у EmbeddingGemma 1; заявлена обработка до 5,5 минуты аудио, 29 изображений или 58 видеокадров.
- В MTEB Code модель получила 78,68 против 68,76 у EmbeddingGemma; компания также заявляет о сильных результатах на MAEB и в задачах работы с изображениями, видео и документами.
- Для квантованного запуска на Google Pixel 11 Pro указано около 191 МБ активной RAM для текстовой версии и около 567 МБ для полной мультимодальной.
- Для разработки перечислены MediaPipe, LiteRT, transformers.js и WebGPU; для запуска — transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio, для векторного хранения — Qdrant.
- Google описывает связку с генеративными моделями, включая Gemma 4: общие текстовый токенизатор и аудиоэнкодер должны уменьшать совокупный расход памяти в едином конвейере.
Как сделано
EmbeddingGemma 2 построена на архитектуре Gemma 4, имеет 740 млн параметров и распространяется по лицензии Apache 2.0. Для текстовых задач можно использовать конфигурацию на 270 млн параметров; для мультимодальности подключаются отдельные энкодеры зрения (170 млн) и аудио (300 млн). Модель формирует эмбеддинги для текста, кода, изображений, видео и аудио в общем пространстве.
Matryoshka Representation Learning позволяет сокращать размер выходных векторов с 768 до 512, 256 или 128 измерений. Контекстное окно — 8K токенов. Google указывает поддержку запуска через MediaPipe и LiteRT, а также браузерных решений transformers.js и WebGPU; для серверного и локального развёртывания перечислены transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio. В качестве хранилища векторов назван Qdrant.
Результаты
Google сообщает о ведущих результатах среди мультимодальных моделей-эмбеддеров с менее чем 1 млрд параметров на бенчмарках MTEB Code и MAEB; по словам компании, модель сопоставима с некоторыми более крупными решениями или превосходит их в задачах текста, зрения и аудио. В MTEB Code результат вырос с 68,76 у EmbeddingGemma до 78,68 — на 9,92 пункта. Уменьшение вектора с 768 до 128 измерений, по заявлению Google, даёт до 6-кратного сокращения хранилища и памяти векторной базы. После квантования на Google Pixel 11 Pro указано около 191 МБ активной RAM для текстового варианта и около 567 МБ для полной мультимодальной модели. Окно 8K токенов, согласно статье, позволяет обрабатывать до 5,5 минуты аудио, 29 изображений или 58 видеокадров.
Ограничения
Материал — анонс Google, а не независимая оценка: подробные метрики отсылают к карточке модели, но в статье не приведены таблицы бенчмарков и протоколы сравнения. Показатели памяти зависят от квантования и конфигурации; заявленные значения для Pixel 11 Pro нельзя автоматически переносить на другие устройства. Не описаны фактические задержки, энергопотребление, качество на конкретных пользовательских данных и затраты на внедрение.
Что взять себе
- Для локального мультимодального поиска можно рассматривать одну модель вместо отдельных специализированных эмбеддеров для разных типов данных.
- Сокращение размерности векторов может уменьшить хранилище и память, но перед выбором 128 или 256 измерений стоит проверить качество поиска на собственных данных.
- Для полностью офлайн-сценариев модель потенциально полезна для приватности и снижения задержки; фактические требования нужно измерить на целевом устройстве.
- Если используется Gemma 4, общие компоненты моделей могут упростить локальный RAG-конвейер, однако заявленную экономию памяти следует подтвердить в своей конфигурации.
Читать оригинал, если…
Откройте оригинал и карточку модели, если нужны полные таблицы бенчмарков, веса, инструкции по развёртыванию и настройке или примеры интеграции с LiteRT.