В обзоре Latent Space говорится, что с 2022 года компоненты конвейера создания машинного интеллекта постепенно переходят от людей к моделям. Сначала это затронуло сигнал вознаграждения. В 2023 году добавились обучающие данные и модель-учитель, а в 2024 году модели начали формировать и учебную программу. Автор обзора называет этот подход симуляцией человеческой работы: «на 10% хуже, но в 100 раз дешевле и в 10 000 раз быстрее».
При оценке результатов InstructGPT использовал модель вознаграждения, обученную на однократно собранных человеческих предпочтениях. Затем основная модель оптимизировалась по ее сигналу. В Constitutional AI появилась самокритика модели по набору принципов через RLAIF. Позже LLM-as-judge стал стандартным методом оценки, в том числе в MT-Bench и AlpacaEval.
Подход к созданию и переработке данных тоже изменился. Серия Microsoft Phi опиралась на синтезированные с помощью LLM материалы учебного качества. Apple WRAP предлагал использовать LLM для переформулирования всего веба, что примерно в 3 раза повышало эффективность предобучения. NVIDIA Nemotron-4 340B включала конвейер генерации синтетических данных с разрешительной лицензией.
На следующих этапах модели объединили в себе роль учителя и составителя учебной программы. Дообучение Alpaca на инструкциях, созданных GPT, стоило 600 $. DeepSeek-R1 вышла вместе с семейством дистиллированных моделей. Еще в 2022 году Self-Instruct и STaR использовали инструкции и цепочки рассуждений, созданные моделями. Self-Rewarding Language Models и SPIN показали, что модель может сама формировать задачи, оценивать результаты и улучшаться сверх предела данных о человеческих предпочтениях.
Ключевые факты
Apple WRAP повышал эффективность предобучения примерно в 3 раза за счет переформулирования веб-данных с помощью LLM.
Дообучение Alpaca на созданных GPT инструкциях стоило 600 $.
NVIDIA Nemotron-4 340B включала конвейер генерации синтетических данных с разрешительной лицензией.
Self-Instruct и STaR использовали создаваемые моделями инструкции и цепочки рассуждений уже в 2022 году.
Вопросы и ответы
- Какой порядок затрат уже показан для обучения на синтетических инструкциях?
Дообучение Alpaca на инструкциях, созданных GPT, стоило 600 $.
- Какой практический выигрыш дает переработка исходных данных моделью?
Apple WRAP переформулировал веб-данные с помощью LLM и повышал эффективность предобучения примерно в 3 раза.
- Какие части конвейера уже можно передать моделям?
Модели могут генерировать инструкции и цепочки рассуждений, формировать задачи и оценивать результаты. Self-Instruct и STaR применяли такой подход уже в 2022 году, а LLM-as-judge используется в MT-Bench и AlpacaEval.