К содержанию
Выпуск №75 · 22 августа 2026 / Новости

Как модели заменяют человеческий труд в обучении ИИ

В обзоре Latent Space говорится, что с 2022 года компоненты конвейера создания машинного интеллекта постепенно переходят от людей к моделям.

Редакция 22 августа 2026 г., 14:14 MSK

В Telegram

В обзоре Latent Space говорится, что с 2022 года компоненты конвейера создания машинного интеллекта постепенно переходят от людей к моделям. Сначала это затронуло сигнал вознаграждения. В 2023 году добавились обучающие данные и модель-учитель, а в 2024 году модели начали формировать и учебную программу. Автор обзора называет этот подход симуляцией человеческой работы: «на 10% хуже, но в 100 раз дешевле и в 10 000 раз быстрее».

При оценке результатов InstructGPT использовал модель вознаграждения, обученную на однократно собранных человеческих предпочтениях. Затем основная модель оптимизировалась по ее сигналу. В Constitutional AI появилась самокритика модели по набору принципов через RLAIF. Позже LLM-as-judge стал стандартным методом оценки, в том числе в MT-Bench и AlpacaEval.

Подход к созданию и переработке данных тоже изменился. Серия Microsoft Phi опиралась на синтезированные с помощью LLM материалы учебного качества. Apple WRAP предлагал использовать LLM для переформулирования всего веба, что примерно в 3 раза повышало эффективность предобучения. NVIDIA Nemotron-4 340B включала конвейер генерации синтетических данных с разрешительной лицензией.

На следующих этапах модели объединили в себе роль учителя и составителя учебной программы. Дообучение Alpaca на инструкциях, созданных GPT, стоило 600 $. DeepSeek-R1 вышла вместе с семейством дистиллированных моделей. Еще в 2022 году Self-Instruct и STaR использовали инструкции и цепочки рассуждений, созданные моделями. Self-Rewarding Language Models и SPIN показали, что модель может сама формировать задачи, оценивать результаты и улучшаться сверх предела данных о человеческих предпочтениях.

Ключевые факты

  • Apple WRAP повышал эффективность предобучения примерно в 3 раза за счет переформулирования веб-данных с помощью LLM.

  • Дообучение Alpaca на созданных GPT инструкциях стоило 600 $.

  • NVIDIA Nemotron-4 340B включала конвейер генерации синтетических данных с разрешительной лицензией.

  • Self-Instruct и STaR использовали создаваемые моделями инструкции и цепочки рассуждений уже в 2022 году.

Вопросы и ответы

Какой порядок затрат уже показан для обучения на синтетических инструкциях?

Дообучение Alpaca на инструкциях, созданных GPT, стоило 600 $.

Какой практический выигрыш дает переработка исходных данных моделью?

Apple WRAP переформулировал веб-данные с помощью LLM и повышал эффективность предобучения примерно в 3 раза.

Какие части конвейера уже можно передать моделям?

Модели могут генерировать инструкции и цепочки рассуждений, формировать задачи и оценивать результаты. Self-Instruct и STaR применяли такой подход уже в 2022 году, а LLM-as-judge используется в MT-Bench и AlpacaEval.

Как процитировать

«Как модели заменяют человеческий труд в обучении ИИ». hegai.media, 22 августа 2026 г.. https://hegai.media/novosti/kak-modeli-zamenyayut-chelovecheskiy-trud-v-obuchenii-ii--6b7d21a8-877d-4fbf-8fe9-3dc659ee2c3a

так материал выглядит в мессенджере