К содержанию
Новости

ИИ-агентам предлагают заранее задавать проверяемый критерий завершения

Инфографика: авторы — преждевременное объявление о готовности легч
Графика: hegai.media

Как сообщает Exponential View (Azeem Azhar), после шести месяцев практики команда пересмотрела семь уроков работы с ИИ-агентами. Агенты могут дольше выполнять сложные задачи, планировать свои действия, использовать инструменты, работать без человеческого надзора и действовать от имени пользователя. Готового руководства по управлению ими пока нет, поэтому команда продолжает экспериментировать и учиться на практике.

Первый урок: еще до постановки цели нужно сформулировать «финишную черту». Иными словами, заранее определить проверяемый признак, по которому работу можно считать завершенной. По опыту авторов, агенты порой объявляют о выполнении задачи слишком рано. Они могут неверно понять цель или самостоятельно решить, каким должен быть результат. Поэтому команда предпочитает подробно описывать критерии завершения.

В техническом примере модуль Python должен содержать шесть функций, каждую проверяют шесть тестов. Работа считается законченной, если все 36 тестов пройдены в Python 3.14, модуль успешно импортируется, входные данные остаются без изменений, а в коде используется только стандартная библиотека.

Для нетехнических задач авторы советуют заранее показать агенту ожидаемый формат результата или дать заполненный шаблон. Если конечный результат сформулирован неясно, его сначала нужно уточнить и лишь затем запускать автономную работу.

Ключевые факты

  • В мае около четверти пользователей Codex хотя бы раз за месяц отправляли запрос на работу, которая заняла бы у человека восемь рабочих часов; в декабре 2025 года доля составляла 2%.

  • Команда обновила внутренний набор из более чем 60 инструментов, которые тестирует, использует или намерена использовать.

  • В примере с модулем Python шесть функций проверяются шестью тестами каждая, всего 36 тестов в Python 3.14.

  • Шаблон нетехнической задачи предусматривает записку на 1 200 слов для совета директоров с решением и тремя аргументами на первой странице.

Вопросы и ответы

Как задать критерий завершения для нетехнической задачи?

Заранее дайте агенту формат или заполненный шаблон. Например, записка для совета директоров должна занимать 1 200 слов, а решение и три аргумента должны находиться на первой странице.

Как выглядит проверяемая «финишная черта» для разработки?

В примере модуль Python содержит шесть функций с шестью тестами на каждую: агент должен пройти все 36 тестов в Python 3.14, обеспечить успешный импорт, не изменять входные данные и использовать только стандартную библиотеку.

Насколько продолжительные задачи уже поручают ИИ-агентам?

В мае около четверти пользователей Codex хотя бы раз за месяц запускали задачу, которая заняла бы у человека восемь рабочих часов. В декабре 2025 года таких пользователей было 2%.

Контекст по теме