Исследователи описали FRAMES для развития LLM-агентов в корпоративных процессах с правилами

Исследователи представили FRAMES, замкнутый фреймворк для развития навыков LLM-агентов, которые работают в корпоративных workflow с жёсткими правилами и требованиями к аудиту. Система рассчитана на сценарии вроде проверки документов: агенту нужно последовательно применять политики, подтверждать каждое значение и сохранять проверяемость своих действий.
Как пишет arXiv cs.AI (Artificial Intelligence), авторы выделяют несколько проблем при улучшении таких агентов. Операционная обратная связь обычно редкая и неразмеченная, изменения одного правила могут ухудшать результаты в других задачах, при этом рост точности не должен приводить к увеличению стоимости инференса или снижению аудируемости.
FRAMES развивает навыки на основе уже существующих ресурсов, после чего использует мутации на базе консенсуса, отбор по Парето с учётом точности и стоимости, а также механизм защиты от регрессий. По данным авторов, после внедрения во внутреннюю производственную систему FRAMES показал лучшее соотношение точности и стоимости среди базовых подходов. Похожие результаты также удалось воспроизвести на tau-bench.
Ключевые факты
FRAMES использует мутации на базе консенсуса и отбор по Парето по двум критериям, точности и стоимости
Авторы заявляют о механизме защиты от регрессий при изменении навыков агентов
Фреймворк был развёрнут во внутренней production-системе авторов
Результаты, полученные во внутренней системе, были воспроизведены на tau-bench
Вопросы и ответы
- Чем FRAMES отличается от обычной донастройки LLM-агентов для корпоративных процессов?
Фреймворк одновременно оптимизирует два критерия, точность и стоимость инференса, через отбор по Парето, а изменения навыков проходят через механизм защиты от регрессий, чтобы новое правило не ухудшало другие задачи.
- Для каких сценариев FRAMES рассчитан на практике?
Система ориентирована на корпоративные workflow с жёсткими правилами и аудитом, например проверку документов, где агент должен пошагово применять политики, подтверждать каждое значение и сохранять проверяемость действий.
- Есть ли признаки, что подход работает вне лаборатории?
FRAMES был развёрнут во внутренней production-системе авторов и там показал лучшее соотношение точности и стоимости по сравнению с базовыми подходами. Эти результаты затем воспроизвели на tau-bench.
Контекст по теме
- Исследователи предложили проверяемый фреймворк для автоматического сбора данных из открытого веба2 июля 2026 г.
- Исследователи представили PolicyGuard для проверки соблюдения политик в LLM-агентах1 июля 2026 г.
- SkillOpt предлагает обучать навыки AI‑агентов через редактирование текстовых политик, а не весов модели29 июня 2026 г.
- AgenticRei: деонтические политики для управления агентными AI‑системами во время работы19 июня 2026 г.