К содержанию
Выпуск №70 · 17 августа 2026 / Новости

В Gemini Enterprise eval агентов стал штатным, выпускать их по демо больше нечем оправдать

Google вывела сервис оценки моделей и агентов в GA: тесты можно запускать в разработке, CI и на реальном трафике. Пользователям платформы пора сравнить встроенный контур со своим, а остальным стоит взять набор Google за минимальную планку.

Редакция 17 августа 2026 г., 13:35 MSK

В Telegram
стенд Google Cloud на конференции Google Cloud Next
Иллюстрация: hegai.media

Google сделала evaluation service в Gemini Enterprise Agent Platform доступным для производственного использования. Это не самая зрелищная функция платформы, зато одна из самых полезных: теперь команде сложнее объяснять релиз агента тем, что на демонстрации он пять раз подряд ответил правильно.

Главное изменение не в количестве метрик, а в месте eval внутри разработки. Google превращает оценку качества из самописной надстройки, которую обещают добавить после пилота, в штатный этап между изменением агента и его выпуском.

Что появилось в платформе

Как пишет Google Developers Blog, сервис дает единый движок для проверки качества агентов и в локальных экспериментах, и на реальном производственном трафике. Это важно: результаты до запуска и после него можно собирать в одном контуре, а не сравнивать таблицу разработчика с логами поддержки.

Внутри доступно более 20 готовых метрик. Команды также могут использовать адаптивные рубрики на технологиях DeepMind, писать собственные проверки в коде или оценивать ответы через LLM as a judge. Метрики хранятся в централизованном реестре с версиями.

Сервис подключается через Agent Platform SDK, agents-cli и ADK. В него встроены симуляторы пользователей и окружения, которые позволяют автоматизировать сложные многоходовые сценарии. Проверки можно встраивать в CI, то есть агент способен не пройти релизный барьер так же буднично, как сборка с упавшими тестами.

Именно это отделяет eval от коллекции удачных промптов. Если сценарии, метрики и версии проверок живут рядом с процессом выпуска, качество хотя бы становится воспроизводимым. Оно не обязано сразу стать высоким, но перестает зависеть от памяти человека, который помнит, на каких вопросах агент обычно ломается.

Google закрывает инфраструктуру, но не решает, что считать хорошим агентом

За последние месяцы Google показывала другую сторону Agent Platform. В блоге компании выходили 13 практических демо, материалы о подключении внешних агентов через удаленный MCP-сервер и рекомендации по обновлению моделей. Это логичная последовательность: сначала платформа учила быстро собирать и соединять агентов, теперь добавляет механизм, который должен мешать выпускать их вслепую.

Для бизнеса это своевременная коррекция. Демо оптимизирует впечатление от лучшего сценария. Eval должен искать регрессии, нестабильность и неудачные траектории системно. Чем проще становится сборка агента, тем больше ценность не еще одного конструктора, а скучной машины проверки. Корпоративный ИИ взрослеет именно в тот момент, когда эффектный ответ перестает считаться доказательством готовности.

Но встроенный сервис не отменяет основную работу. Google не может выбрать за компанию реальные пользовательские сценарии, определить допустимые ошибки и решить, какой провал блокирует релиз. Команде все равно придется собрать собственный набор задач из бизнес-процесса, зафиксировать ожидаемые результаты, назначить пороги и договориться, кто разбирает упавшую проверку.

Отдельная ловушка скрыта в LLM as a judge. Возможность вызвать модель-судью еще не делает ее оценку истиной. На практике компании нужен свой процесс калибровки: сравнивать решения судьи с ручной проверкой и пересматривать рубрики, когда меняется модель, агент или сам продукт. Версионируемый реестр помогает хранить эту дисциплину, но не создает ее автоматически.

Что делать командам

Пользователям Gemini Enterprise стоит до следующего релиза сопоставить встроенные evals со своим харнессом. Что уже можно перенести в сервис Google, какие проверки должны остаться в коде, есть ли многоходовые сценарии, запускаются ли они в CI и используется ли производственный трафик для поиска новых регрессий. Если собственного контура пока нет, GA убирает последнее удобное оправдание откладывать его на потом.

Тем, кто работает на другом стеке, полезен сам состав системы: готовые метрики, рубрики, программные проверки, LLM-судья, симуляторы, версии и интеграция с CI. Это разумный ориентир для минимального eval-контура, даже если все его части придется собирать самостоятельно.

Маркер успеха здесь конкретный. Если следующий релиз агента сопровождается версией набора проверок, зафиксированными порогами и автоматическим прогоном многоходовых сценариев, eval действительно стал частью производства. Если команда по-прежнему показывает несколько красивых диалогов в чате, GA остался еще одной галочкой в каталоге платформы.

Как процитировать

«В Gemini Enterprise eval агентов стал штатным, выпускать их по демо больше нечем оправдать». hegai.media, 17 августа 2026 г.. https://hegai.media/novosti/v-gemini-enterprise-eval-agentov-stal-shtatnym-vypuskat-ih-po-demo-bol--9847d4d3-04f9-4bdd-81eb-8221a4d4b4ec

так материал выглядит в мессенджере