6 октября 2026 года Google DeepMind выпустила EmbeddingGemma 2, открытую по весам модель для мультимодального поиска. Она переводит текст, код, изображения, аудио и видеокадры в сопоставимые наборы чисел, а затем позволяет находить близкие по смыслу объекты. Модель содержит 740 млн параметров и рассчитана в том числе на локальный запуск на телефонах, ноутбуках и собственных серверах.
Для разработчиков существенны сразу три изменения: EmbeddingGemma впервые вышла за пределы текста, получила лицензию Apache 2.0 и осталась меньше миллиарда параметров. Это делает мультимодальный поиск доступнее проектам, которые не хотят отправлять документы и медиатеку во внешний API. Но почти все опубликованные показатели качества пока принадлежат Google, а в публичном репозитории MTEB на момент проверки результатов модели не было.
Что произошло и почему это важно
Предыдущее поколение EmbeddingGemma обрабатывало текст. EmbeddingGemma 2 объединяет текст, код, изображения, видео и аудио в одном 768-мерном пространстве. Связанные объекты должны получать близкие векторы: например, фраза «кот спит на клавиатуре» и подходящая фотография.
Google предлагает применять модель для семантического поиска, рекомендаций, классификации и RAG, где генеративная система сначала извлекает подходящие материалы из базы, а затем формирует ответ. В мультимодальном варианте извлекать можно не только абзацы, но и сканы, иллюстрации, записи или моменты внутри видео.
Компания показывает две локальные демонстрации. Instant Media Search ищет фотографии и ролики по тексту или другой картинке, сохраняя векторы медиатеки в SQLite. Video Moments Finder индексирует видеокадры и аудиофрагменты, чтобы находить моменты по запросам наподобие «собака ловит фрисби». По описанию Google, вычисления выполняются на устройстве без обязательного подключения к интернету.
Это не означает, что модель уже обеспечивает готовый потребительский поиск на любом смартфоне. Разработчику по-прежнему нужно встроить ее в приложение, проиндексировать коллекцию и реализовать хранение и ранжирование результатов. Google обещает в ближайшие недели добавить модель как сервис Android через ML Kit, но сроки и список совместимых устройств пока не раскрыты.
Как одна модель сравнивает разные типы данных
Эмбеддинг — числовое представление объекта. Вместо буквального совпадения слов система сравнивает направления векторов и оценивает смысловую близость. Благодаря этому файл IMG_1842 может находиться по описанию содержимого, даже если нужных слов нет в его названии или метаданных.
В EmbeddingGemma 2 текстовая основа содержит 270 млн параметров. К ней можно подключить модуль изображений на 170 млн и аудиомодуль на 300 млн параметров. Видео обрабатывается через кадры, а звук поступает в аудиоэнкодер. Все модули выдают совместимые векторы длиной 768 чисел.
Модульность позволяет не загружать ненужные части. Текстовому поиску достаточно основы на 270 млн параметров, тексту с изображениями — конфигурации на 440 млн, тексту со звуком — на 570 млн. Полная версия занимает 740 млн параметров.
Во время индексации модель вычисляет вектор для каждого документа или медиафрагмента. При запросе она создает еще один вектор и ищет ближайшие элементы в базе. Сам вектор не заменяет исходный файл и не хранит его содержимое в читаемом виде: это сжатое представление признаков, которые модель сочла полезными.
Для разных задач предусмотрены текстовые префиксы. Запрос и документ при поиске кодируются по-разному, а при классификации используется одинаковая инструкция. Карточка модели предупреждает, что пропуск подходящего префикса не вызывает ошибку, но снижает точность.
Размер, память и качество в цифрах
Полная модель содержит 740 млн параметров: 270 млн приходится на текст и код, 170 млн — на зрительный модуль, 300 млн — на аудио. Контекст составляет 8192 токена. По данным Google, в него помещаются до 29 изображений, 58 видеокадров или примерно 5,5 минуты аудио, а также их комбинации.
На квантованной сборке для Pixel 11 Pro Google измерила около 191 МБ активной памяти у текстовой конфигурации и около 567 МБ у полной. Это показатели одного устройства и одной реализации, а не гарантированные требования для любого телефона или компьютера.
Векторы можно сокращать с 768 до 512, 256 или 128 чисел. Для миллиона векторов в формате bfloat16 Google оценивает хранилище примерно в 1,5 ГБ при 768 измерениях и 250 МБ при 128. Экономия достигает шести раз, но качество падает неравномерно.
Согласно руководству Google, вариант на 256 измерений сохраняет большую часть качества текста и кода и около 95% исходного результата для изображений, видео и речи. На 128 измерениях мультимодальные результаты деградируют заметнее. The Frontier приводит более жесткое сравнение из таблиц Google: общий показатель MMEB снижается с 59,01 до 45,65.
После сокращения вектор необходимо заново нормализовать. Иначе система продолжит выдавать правдоподобные оценки близости, но порядок результатов незаметно ухудшится. Запросы и документы также должны иметь одинаковую размерность.
Еще одно техническое ограничение связано с точностью вычислений. Карточка модели рекомендует bfloat16 или float32 и предостерегает от float16: в этом режиме возможны NaN или испорченные эмбеддинги без явной ошибки.
Наиболее заметный заявленный прирост относится к поиску по коду: результат MTEB Code вырос с 68,76 у первой версии до 78,68. Многоязычный текстовый показатель, по подсчетам The Frontier, изменился лишь с 61,15 до 61,36. На аудиографике самой Google модель jina-embeddings-v5-omni-nano расположена выше EmbeddingGemma 2, хотя конкурент использует некоммерческую лицензию CC BY-NC 4.0. Поэтому формулировку Google о лидерстве следует понимать с учетом размера модели, конкретного теста и условий лицензирования.
Кто выигрывает и кто платит
EmbeddingGemma 2 подходит владельцам медиатек, товарных каталогов, архивов документов и репозиториев кода. Интернет-магазин может искать похожие товары по фотографии, студия — находить материал по описанию сцены, а разработчики — индексировать исходный код для поисковых и агентных систем.
Главное преимущество локального запуска — контроль над данными. После получения весов документы, фотографии и записи можно обрабатывать внутри собственной инфраструктуры. Это снижает зависимость от внешнего API и позволяет строить офлайн-функции, но само по себе не гарантирует соответствия требованиям безопасности и законодательства.
Цена локальности переносится на владельца системы. Нужно вычислить эмбеддинги всего архива, хранить векторный индекс, обеспечить быстрый поиск и наблюдать за качеством выдачи. Миллион объектов даже после сокращения векторов требует отдельного хранилища, а крупную видеотеку приходится делить на кадры или фрагменты.
Переход на новую модель или изменение способа кодирования может потребовать переиндексации. Внутри одной EmbeddingGemma 2 модульные конфигурации используют общее пространство, поэтому Google разрешает позднее подключить зрительный или аудиомодуль без пересчета уже созданных текстовых векторов. Но это преимущество нельзя автоматически переносить на переход между разными моделями или поколениями.
Apache 2.0 допускает коммерческое использование весов, однако The Frontier обращает внимание и на ссылку карточки модели на Gemma Prohibited Use Policy. Перед внедрением условия лицензии и дополнительной политики нужно отдельно проверить с юристами, особенно если система работает с биометрией, наблюдением или чувствительными данными.
Последствия для проектов в России
Источники не подтверждают отдельный российский запуск EmbeddingGemma 2 или официальную поддержку местного рынка. Практическая ценность модели для российских команд в другом: веса опубликованы на Hugging Face и Kaggle, а запуск не требует постоянного обращения к Google API. Если организация может законно получить модель и развернуть ее, обработку можно оставить на собственном сервере или устройстве.
Такой вариант интересен компаниям с внутренними документами, фотографиями производства, записями встреч и другими материалами, которые нежелательно передавать зарубежному облачному сервису. Он также позволяет заранее оценивать расходы на собственную инфраструктуру вместо оплаты каждого запроса к API.
Главная неопределенность — качество на русских данных. Google заявляет поддержку более 100 языков, но не публикует отдельный результат для русского мультимодального поиска. Текстовая многоязычная оценка почти не выросла относительно предыдущей версии, а независимого набора тестов EmbeddingGemma 2 на момент проверки еще не было в публичном репозитории MTEB.
Перед полной индексацией российскому проекту нужен собственный тест: реальные запросы пользователей, профессиональная лексика, смешение русского и английского, сканы плохого качества и изображения, где ответ зависит от мелкой детали. Отдельно следует сравнить 768, 256 и 128 измерений, поскольку экономия места может изменить первые позиции выдачи именно на сложных мультимодальных запросах.
Вопросы и ответы
- Что такое мультимодальные эмбеддинги?
Это числовые представления текста, изображений, звука и видео в общей системе координат. Они позволяют сравнить объекты разных типов и найти фотографию по фразе, видеомомент по описанию или документ по изображению.
- Может ли EmbeddingGemma 2 работать без облака Google?
Да, модель рассчитана на локальное развертывание, а ее веса опубликованы под Apache 2.0. При этом разработчик самостоятельно отвечает за вычисления, индекс, обновления и проверку дополнительных условий использования Gemma.
- Сколько памяти требуется модели?
В тесте Google на Pixel 11 Pro текстовая конфигурация использовала около 191 МБ активной памяти, полная мультимодальная — около 567 МБ. Реальный показатель зависит от оборудования, библиотеки, квантования и выбранных модулей.
- Нужно ли всегда хранить векторы из 768 чисел?
Нет, модель поддерживает 512, 256 и 128 измерений. После сокращения векторы необходимо нормализовать заново, а запрос и документы должны иметь одинаковую размерность. Для мультимодального поиска вариант на 128 измерений нужно особенно тщательно проверять из-за падения качества.
- Подходит ли float16 для запуска?
Нет. Карточка модели предупреждает, что float16 может приводить к NaN или незаметно поврежденным эмбеддингам. Google рекомендует bfloat16 на совместимом оборудовании и float32 в остальных случаях.
- Хорошо ли модель работает на русском?
Подтверждена общая поддержка более 100 языков, но на момент проверки в публичном репозитории MTEB не было результатов EmbeddingGemma 2. Решение о внедрении следует принимать только после теста на собственных документах, изображениях, записях и запросах.

