К содержанию
Новости

Разработчики вертикальных AI-агентов назвали цикл обратной связи главным ограничением внедрения

Абстрактная графика hegai.media: широкие лучи, расходящиеся из одной точки, поверх тонкой лучевой разметки
Графика: hegai.media

Авторы Kinesthetic считают, что главная проблема корпоративных AI-агентов сегодня связана не с качеством базовых моделей, а с тем, как команды собирают и используют обратную связь от экспертов предметной области. В статье описывается типичный процесс: трассировки из платформ наблюдаемости выгружают в таблицы, специалисты вручную отмечают ошибки, затем замечания превращают в задачи для Linear или Jira, после чего инженер меняет промпты без полноценной проверки. Авторы полагают, что этот подход пришел из классической разработки ПО и плохо подходит для систем на базе машинного обучения.

Как сообщает Hacker News, авторы сравнивают ситуацию в вертикальных AI-сценариях с успехом coding-агентов вроде Claude Code, Codex и Cursor. По их словам, в программировании есть проверяемый результат, много качественных данных и совпадают роли инженера и эксперта предметной области. В юридических, финансовых и других «беловоротничковых» задачах все устроено иначе: корректность часто зависит от профессионального суждения, а готовых тестовых наборов и объективных критериев оценки почти нет.

В качестве примера в статье приводятся открытые бенчмарки Harvey Legal Agent Benchmark и Sierra τ³-Banking. По этим данным модель Fable 5 получила 14,2% и 26,8% соответственно. Авторы утверждают, что современные frontier-модели способны проходить большую часть отдельных критериев оценки, но полностью завершают лишь небольшую долю задач. Они связывают основной дефицит не с нехваткой знаний, а с неспособностью стабильно соблюдать сложные процедуры и удерживать неформализованные требования в длинных цепочках действий.

Ключевые факты

  • Авторы описывают типичный процесс улучшения агентов через экспорт трассировок, ручную разметку SME и задачи в Linear или Jira.

  • В статье упомянуты coding-агенты Claude Code, Codex и Cursor как примеры систем с заметной практической ценностью.

  • Harvey, Sierra и Clay названы компаниями, построившими бизнесы вокруг специализированных AI-агентов.

  • По данным статьи, модель Fable 5 набрала 14,2% в Harvey Legal Agent Benchmark и 26,8% в Sierra τ³-Banking.

Вопросы и ответы

Почему авторы считают главным ограничением не качество моделей, а процесс внедрения?

Команды до сих пор улучшают агентов через ручной цикл: экспортируют трассировки в таблицы, SME размечают ошибки, замечания превращают в задачи в Linear или Jira, а инженеры меняют промпты без полноценной проверки результата. Авторы считают, что такой процесс унаследован из классической разработки ПО и плохо подходит для ML-систем.

Почему coding-агенты вроде Claude Code и Cursor показывают более заметную практическую ценность, чем AI-агенты для юристов или банков?

В программировании есть проверяемый результат, много качественных данных и часто совпадают роли инженера и эксперта предметной области. В юридических и финансовых задачах корректность зависит от профессионального суждения, а объективных тестов и готовых датасетов почти нет.

Насколько далеки специализированные AI-агенты от полного выполнения сложных задач?

В статье приводятся результаты Fable 5: 14,2% в Harvey Legal Agent Benchmark и 26,8% в Sierra τ³-Banking. Авторы утверждают, что frontier-модели уже проходят многие отдельные критерии оценки, но полностью завершают лишь небольшую долю реальных задач.

Контекст по теме