Google DeepMind представила EmbeddingGemma 2 на базе архитектуры Gemma 4 с 740 миллионами параметров, которая сопоставляет текст, код, изображения, видео и аудио в едином векторном пространстве. Модель распространяется по лицензии Apache 2.0 и оптимизирована под потребительское железо, что сокращает зависимость от дорогостоящей облачной инфраструктуры и внешних вызовов API.
EmbeddingGemma 2 содержит 740 миллионов параметров, что делает ее оптимальной для локального запуска.
Экономика инфраструктуры и гибкость развертывания
Как пояснили в Google DeepMind, модель использует модульную конструкцию, требующую всего 270 миллионов параметров для обработки чистого текста, дополненную опциональными визуальными энкодерами на 170 миллионов параметров и аудиоэнкодерами на 300 миллионов параметров.
Это обеспечивает до шестикратного сокращения объема памяти для локальных векторных баз данных.
При работе на Google Pixel 11 Pro с использованием квантования модель потребляет около 191 МБ активной оперативной памяти для текстовых весов и 567 МБ для полноценной мультимодальной настройки. Это переносит тяжелые вычислительные нагрузки с дорогих облачных кластеров прямо на локальное железо.
Производительность и корпоративная интеграция
Контекстное окно расширено до 8K токенов — это четырехкратное увеличение по сравнению с первой версией. Модель локально обрабатывает до 5,5 минут аудио, 29 изображений или 58 видеокадров. В бенчмарке MTEB Code результат вырос на 9,92 балла, поднявшись с 68,76 до 78,68, задавая темп для моделей с количеством параметров менее одного миллиарда. Веса уже доступны на Hugging Face и Kaggle, а грядущая интеграция с платформой Gemini Enterprise Agent Platform Model Garden указывает на целенаправленный выход в корпоративную инфраструктуру.
Опираясь на более чем 20 миллионов загрузок первой версии, разработчики используют подобные решения для создания локальных инструментов поиска и RAG-пайплайнов с фокусом на конфиденциальность.