К содержанию
Выпуск №79 · 26 августа 2026 / Новости

Фильтрация неудачных траекторий лишает модели обучающего сигнала при дистилляции вызова инструментов

Контролируемое дообучение на траекториях, созданных моделью-учителем, обычно служит первым этапом переноса навыков вызова инструментов в модели для развертывания.

Редакция 26 августа 2026 г., 21:29 MSK

В Telegram

Контролируемое дообучение на траекториях, созданных моделью-учителем, обычно служит первым этапом переноса навыков вызова инструментов в модели для развертывания. Как сообщает Apple Machine Learning Research в материале о PROOF-Gen, конвейеры постобучения рабочих агентов запускают этот процесс ежедневно или еженедельно. Каждый такой запуск требует оплаты передовой модели-учителя.

Система генерирует траектории, а затем фильтрует их: успешные сохраняет, остальные отбрасывает. Поэтому неудачные попытки не дают обучающего сигнала, и сложные сценарии остаются нерешенными от цикла к циклу. На τ 2-bench учитель не справился с 57% испытаний. Однако две трети неудачных попыток были близки к успеху, поскольку большинство вызовов инструментов выполнялось правильно.

Ключевые факты

  • Конвейеры постобучения повторяют этап контролируемого дообучения ежедневно или еженедельно.

  • На τ 2-bench неудачей завершились 57% испытаний модели-учителя.

  • Две трети неудачных испытаний были близки к успеху: большинство вызовов инструментов выполнялось правильно.

Вопросы и ответы

Кого это касается на практике?

Команд, которые ежедневно или еженедельно дообучают рабочих агентов на траекториях передовой модели-учителя и оплачивают ее использование в каждом цикле.

Сколько потенциально полезных данных теряет стандартная фильтрация?

На τ 2-bench учитель провалил 57% испытаний, а две трети этих попыток были близки к успеху. Это около 38% всех испытаний, где большинство вызовов инструментов уже выполнялось правильно, но траектории все равно отбрасывались.

Что это меняет в процессе обучения агента?

Стандартная схема сохраняет только полностью успешные траектории, поэтому частично верные попытки не дают обучающего сигнала. В результате сложные сценарии могут оставаться нерешенными при каждом ежедневном или еженедельном цикле.

Контекст по теме

Как процитировать

«Фильтрация неудачных траекторий лишает модели обучающего сигнала при дистилляции вызова инструментов». hegai.media, 26 августа 2026 г.. https://hegai.media/novosti/filtratsiya-neudachnyh-traektoriy-lishaet-modeli-obuchayuschego-signal--5f9afe1c-178f-4ddb-acae-39164066aa16

так материал выглядит в мессенджере