ИИ-агентам предлагают заранее задавать проверяемый критерий завершения

Как сообщает Exponential View (Azeem Azhar), после шести месяцев практики команда пересмотрела семь уроков работы с ИИ-агентами. Агенты могут дольше выполнять сложные задачи, планировать свои действия, использовать инструменты, работать без человеческого надзора и действовать от имени пользователя. Готового руководства по управлению ими пока нет, поэтому команда продолжает экспериментировать и учиться на практике.
Первый урок: еще до постановки цели нужно сформулировать «финишную черту». Иными словами, заранее определить проверяемый признак, по которому работу можно считать завершенной. По опыту авторов, агенты порой объявляют о выполнении задачи слишком рано. Они могут неверно понять цель или самостоятельно решить, каким должен быть результат. Поэтому команда предпочитает подробно описывать критерии завершения.
В техническом примере модуль Python должен содержать шесть функций, каждую проверяют шесть тестов. Работа считается законченной, если все 36 тестов пройдены в Python 3.14, модуль успешно импортируется, входные данные остаются без изменений, а в коде используется только стандартная библиотека.
Для нетехнических задач авторы советуют заранее показать агенту ожидаемый формат результата или дать заполненный шаблон. Если конечный результат сформулирован неясно, его сначала нужно уточнить и лишь затем запускать автономную работу.
Ключевые факты
В мае около четверти пользователей Codex хотя бы раз за месяц отправляли запрос на работу, которая заняла бы у человека восемь рабочих часов; в декабре 2025 года доля составляла 2%.
Команда обновила внутренний набор из более чем 60 инструментов, которые тестирует, использует или намерена использовать.
В примере с модулем Python шесть функций проверяются шестью тестами каждая, всего 36 тестов в Python 3.14.
Шаблон нетехнической задачи предусматривает записку на 1 200 слов для совета директоров с решением и тремя аргументами на первой странице.
Вопросы и ответы
- Как задать критерий завершения для нетехнической задачи?
Заранее дайте агенту формат или заполненный шаблон. Например, записка для совета директоров должна занимать 1 200 слов, а решение и три аргумента должны находиться на первой странице.
- Как выглядит проверяемая «финишная черта» для разработки?
В примере модуль Python содержит шесть функций с шестью тестами на каждую: агент должен пройти все 36 тестов в Python 3.14, обеспечить успешный импорт, не изменять входные данные и использовать только стандартную библиотеку.
- Насколько продолжительные задачи уже поручают ИИ-агентам?
В мае около четверти пользователей Codex хотя бы раз за месяц запускали задачу, которая заняла бы у человека восемь рабочих часов. В декабре 2025 года таких пользователей было 2%.
Контекст по теме
- Опубликовано практическое руководство по AI-агентам для бизнес-задач30 июля 2026 г.
- Paul Bakaus предложил подход «skill engineering» для управления AI-агентами в дизайне2 июля 2026 г.
- Шесть no-code инструментов для разработки AI‑приложений: подборка платформ для инженеров и разработчиков30 июня 2026 г.
- Полевой гид по современному ИИ: десять ключевых концепций19 июня 2026 г.