Hugging Face показала неприятный для привычной инженерной логики результат: модель в MXFP4 оказалась точнее собственного bfloat16-чекпойнта на 7 из 9 бенчмарков. Если результат воспроизводится за пределами одного эксперимента, командам больше не нужно автоматически выбирать между качеством и дешёвым инференсом. Но пока перед нами сильный кейс, а не универсальная лицензия квантизировать всё подряд.
Что произошло
В блоге Hugging Face описан метод Quantization-Aware Healing, или QAH. Его применили к GPT-OSS 120B, сначала структурно сжатой до 60 млрд параметров, а затем переведённой в MXFP4.
Получившаяся 4-битная модель обошла свою 60B-версию в bfloat16 на семи из девяти бенчмарков. На MMLU-Pro и SciCode она отстала менее чем на 1,5 пункта. Самые заметные улучшения пришлись на long-context reasoning: +7,4 пункта на AA-LCR, и математику: +5,6 на AIME 2025.
Сравнение с исходной 120B-моделью тоже выглядит серьёзно. QAH-версия набрала 66,5 против 66,0 на LiveCodeBench и 67,4 против 69,0 на GPQA Diamond, хотя у неё вдвое меньше параметров и примерно четверть памяти под веса. Самый большой разрыв с учителем сохранился на AA-LCR, где потерянную при структурном сжатии ёмкость восстановить сложнее всего.
Почему 4 бита внезапно стали умнее
Обычный конвейер эффективности выглядит так: архитектуру сокращают, веса квантизируют, затем пытаются вылечить нанесённый ущерб. Спор идёт именно о последнем этапе.
При quantization-aware training модель продолжают обучать на целевой функции с имитацией низкой точности в forward pass. По данным Hugging Face, это требует фактически повторять дорогую постобработку модели и может становиться нестабильным, если обучение продолжается после лучшей точки.
Quantization-aware distillation обходится без повторения всей этой истории: квантизированного студента учат повторять распределение логитов полноточного учителя. Это работает, пока меняется только точность весов. После структурного сжатия точного полноразмерного аналога новой архитектуры уже нет. Если взять учителем восстановленный BF16-чекпойнт, студент упрётся в его потолок.
QAH меняет учителя. 60B-студент в MXFP4 дистиллируется напрямую из исходной 120B-модели, несмотря на несовпадение архитектур. Вместо жёстких меток он получает распределение выходов учителя через KL divergence. Поэтому квантизация становится не финальной упаковкой уже вылеченной модели, а ещё одним полным проходом дистилляции. Студент не только компенсирует потери от четырёх бит, но и добирает знания, которые не успел перенять при предыдущем восстановлении.
Для контекста до 32 тысяч токенов авторы используют chunked KL loss: функция считает расхождение по частям последовательности и не держит в памяти всю матрицу «словарь на длину контекста». Иначе лечение длинного контекста быстро превратилось бы в упражнение по покупке GPU.
Что это меняет для бизнеса
Главные кандидаты на повторный тест QAH очевидны: команды, которые уже структурно сжимают LLM, но оставляют рабочий чекпойнт в FP16 или BF16 из-за просадки качества после квантизации. Теперь 4-битный контур стоит проверять не как заведомо худшую копию, а как отдельный этап обучения с собственным потенциалом качества.
Практический выигрыш тоже понятен. Меньший объём весов может освободить память под больший batch size или позволить запускать модель на более дешёвой конфигурации. Hugging Face прямо называет получившуюся модель меньшей и более дешёвой в работе. Цена этой экономии переносится в обучение: нужен ещё один проход дистилляции от исходного полноразмерного учителя, а его логиты авторы предварительно вычисляют офлайн.
Но переносить цифры на любую модель рано. В опубликованном описании показана одна траектория: GPT-OSS 120B, структурное сжатие до 60B и MXFP4. Из доступного текста также нельзя установить, опубликованы ли код и полный рецепт, достаточный для независимого повторения результата. Нет и результатов на других размерах, архитектурах или форматах квантизации.
Поэтому правильное действие сейчас не миграция продакшена, а контролируемый эксперимент на собственной модели: одинаковый набор тестов, одинаковый BF16-бейзлайн и отдельный учёт стоимости healing-прохода.
Маркер успеха QAH прост: публичный код и независимое воспроизведение на второй архитектуре, где 4-битный студент снова стабильно обходит свой полноточный чекпойнт, а не выигрывает один удобный бенчмарк. Если это произойдёт, хранить BF16 только ради качества станет инженерной привычкой, которую пора пересматривать.