К содержанию
Выпуск №1 · 9 июня 2026 / Новости

Эксперименты показывают рост управляемости CoT после небольшого fine-tuning

Исследователи опубликовали результаты экспериментов о том, как меняется управляемость CoT после дополнительного обучения моделей.

Редакция 9 июня 2026 г., 15:56 MSK

В Telegram

Исследователи опубликовали результаты экспериментов о том, как меняется управляемость CoT после дополнительного обучения моделей. В работе дообучили четыре reasoning models на небольших наборах данных с instruction-following reasoning: всего 240 examples (примерно ~100K–300K tokens). После такого fine-tuning показатель OOD‑управляемости на задачах из CoTControl eval suite вырос в среднем с 2.9% до 8.8% для всех четырех моделей. Обучение проводилось на данных из ReasonIF eval suite, затем проверяли, как модели обобщают поведение на CoTControl.

Самый заметный рост оказался в инструкциях, где требовалось рассуждать в заданном регистре, избегать определённых слов или добавлять в reasoning заранее предоставленные предложения. Значение 8.8% всё ещё остаётся низким. Тем не менее авторы обращают внимание: даже небольшое количество fine-tuning может повышать controllability, это намекает, что низкая управляемость CoT может быть неустойчивой и меняться под случайным оптимизационным давлением.

Авторы отдельно обсуждают ограничения эксперимента. По их мнению, маловероятно, что frontier AI labs будут проводить даже небольшое fine-tuning специально ради controllability, поэтому выбранная постановка может выглядеть нереалистичной. Пока также не показано, ведёт ли рост controllability к снижению monitorability. Остаётся открытым вопрос, как эти результаты переносятся на multi-turn или agentic settings. Есть и ещё одна оговорка: CoTControl может быть менее OOD по отношению к ReasonIF, чем кажется, потому что структуры eval похожи и частично пересекаются. Если убрать из CoTControl тип инструкции Use uppercase letters, средний рост controllability снижается лишь с 5.9% до 5.0%.

Ключевые факты

  • В эксперименте были дообучены 4 reasoning‑модели на небольшом датасете из 240 примеров (примерно 100K–300K токенов) с инструкциями на следование формату рассуждений.

  • Средняя OOD‑управляемость CoT на наборе задач CoTControl выросла с 2.9% до 8.8% после такого дообучения.

  • Наибольший рост наблюдался для инструкций, требующих рассуждать в заданном регистре, подавлять определённые слова и добавлять предоставленные предложения в рассуждение.

  • При исключении из CoTControl инструкции «Use uppercase letters» средний рост управляемости снижается с 5.9% до 5.0%.

Как процитировать

«Эксперименты показывают рост управляемости CoT после небольшого fine-tuning». hegai.media, 9 июня 2026 г.. https://hegai.media/novosti/eksperimenty-pokazyvayut-rost-upravlyaemosti-cot-posle-nebolshogo-fine--1b54ea67-4307-4f1f-b201-989f6ab99330

так материал выглядит в мессенджере