Разработчики вертикальных AI-агентов назвали цикл обратной связи главным ограничением внедрения

Авторы Kinesthetic считают, что главная проблема корпоративных AI-агентов сегодня связана не с качеством базовых моделей, а с тем, как команды собирают и используют обратную связь от экспертов предметной области. В статье описывается типичный процесс: трассировки из платформ наблюдаемости выгружают в таблицы, специалисты вручную отмечают ошибки, затем замечания превращают в задачи для Linear или Jira, после чего инженер меняет промпты без полноценной проверки. Авторы полагают, что этот подход пришел из классической разработки ПО и плохо подходит для систем на базе машинного обучения.
Как сообщает Hacker News, авторы сравнивают ситуацию в вертикальных AI-сценариях с успехом coding-агентов вроде Claude Code, Codex и Cursor. По их словам, в программировании есть проверяемый результат, много качественных данных и совпадают роли инженера и эксперта предметной области. В юридических, финансовых и других «беловоротничковых» задачах все устроено иначе: корректность часто зависит от профессионального суждения, а готовых тестовых наборов и объективных критериев оценки почти нет.
В качестве примера в статье приводятся открытые бенчмарки Harvey Legal Agent Benchmark и Sierra τ³-Banking. По этим данным модель Fable 5 получила 14,2% и 26,8% соответственно. Авторы утверждают, что современные frontier-модели способны проходить большую часть отдельных критериев оценки, но полностью завершают лишь небольшую долю задач. Они связывают основной дефицит не с нехваткой знаний, а с неспособностью стабильно соблюдать сложные процедуры и удерживать неформализованные требования в длинных цепочках действий.
Ключевые факты
Авторы описывают типичный процесс улучшения агентов через экспорт трассировок, ручную разметку SME и задачи в Linear или Jira.
В статье упомянуты coding-агенты Claude Code, Codex и Cursor как примеры систем с заметной практической ценностью.
Harvey, Sierra и Clay названы компаниями, построившими бизнесы вокруг специализированных AI-агентов.
По данным статьи, модель Fable 5 набрала 14,2% в Harvey Legal Agent Benchmark и 26,8% в Sierra τ³-Banking.
Вопросы и ответы
- Почему авторы считают главным ограничением не качество моделей, а процесс внедрения?
Команды до сих пор улучшают агентов через ручной цикл: экспортируют трассировки в таблицы, SME размечают ошибки, замечания превращают в задачи в Linear или Jira, а инженеры меняют промпты без полноценной проверки результата. Авторы считают, что такой процесс унаследован из классической разработки ПО и плохо подходит для ML-систем.
- Почему coding-агенты вроде Claude Code и Cursor показывают более заметную практическую ценность, чем AI-агенты для юристов или банков?
В программировании есть проверяемый результат, много качественных данных и часто совпадают роли инженера и эксперта предметной области. В юридических и финансовых задачах корректность зависит от профессионального суждения, а объективных тестов и готовых датасетов почти нет.
- Насколько далеки специализированные AI-агенты от полного выполнения сложных задач?
В статье приводятся результаты Fable 5: 14,2% в Harvey Legal Agent Benchmark и 26,8% в Sierra τ³-Banking. Авторы утверждают, что frontier-модели уже проходят многие отдельные критерии оценки, но полностью завершают лишь небольшую долю реальных задач.
Контекст по теме
- Исследования показывают разрыв между бюджетами на ИИ и их внедрением в продакшен28 июля 2026 г.
- Компании столкнулись с проблемой объяснимости автономных ИИ-систем16 июля 2026 г.
- Apollo: окупаемость AI за пределами IT-сектора может наступить позже ожиданий рынка6 июля 2026 г.
- Авторы книги Purposeful AI призвали компании разделять оптимизацию и создание новой ценности при внедрении ИИ5 июля 2026 г.