Контролируемое дообучение на траекториях, созданных моделью-учителем, обычно служит первым этапом переноса навыков вызова инструментов в модели для развертывания. Как сообщает Apple Machine Learning Research в материале о PROOF-Gen, конвейеры постобучения рабочих агентов запускают этот процесс ежедневно или еженедельно. Каждый такой запуск требует оплаты передовой модели-учителя.
Система генерирует траектории, а затем фильтрует их: успешные сохраняет, остальные отбрасывает. Поэтому неудачные попытки не дают обучающего сигнала, и сложные сценарии остаются нерешенными от цикла к циклу. На τ 2-bench учитель не справился с 57% испытаний. Однако две трети неудачных попыток были близки к успеху, поскольку большинство вызовов инструментов выполнялось правильно.
Ключевые факты
Конвейеры постобучения повторяют этап контролируемого дообучения ежедневно или еженедельно.
На τ 2-bench неудачей завершились 57% испытаний модели-учителя.
Две трети неудачных испытаний были близки к успеху: большинство вызовов инструментов выполнялось правильно.
Вопросы и ответы
- Кого это касается на практике?
Команд, которые ежедневно или еженедельно дообучают рабочих агентов на траекториях передовой модели-учителя и оплачивают ее использование в каждом цикле.
- Сколько потенциально полезных данных теряет стандартная фильтрация?
На τ 2-bench учитель провалил 57% испытаний, а две трети этих попыток были близки к успеху. Это около 38% всех испытаний, где большинство вызовов инструментов уже выполнялось правильно, но траектории все равно отбрасывались.
- Что это меняет в процессе обучения агента?
Стандартная схема сохраняет только полностью успешные траектории, поэтому частично верные попытки не дают обучающего сигнала. В результате сложные сценарии могут оставаться нерешенными при каждом ежедневном или еженедельном цикле.
Контекст по теме
- Исследование: улучшение ответов ИИ в диалоге не всегда связано с качеством обратной связи1 июля 2026 г.
- WinDOM и Self-Family Distillation: подход к обучению небольших GUI‑агентов без ручной разметки25 июня 2026 г.
- Метод SGPO предлагает обучать слабые языковые модели стратегиям рассуждения вместо копирования решений24 июня 2026 г.
- Eugene Yan описал подходы к генерации и использованию синтетических данных для финетюнинга9 июня 2026 г.