Ant открыла не просто еще две base-модели, а шесть точек входа в их обучение. Для команд, которые строят узкие модели, это полезнее очередного соревнования параметров: теперь можно взять Ling-3.0 до финального слияния весов, добавить собственные данные и проверить, нужна ли вообще стандартная траектория разработчика модели.
Экономия здесь пока не факт, а возможность. Публикация промежуточных весов убирает часть дорогой подготовительной работы, но не отменяет вычисления, постобучение и оценку качества.
Что именно открыли
IT Home пишет, что Ant Bailing опубликовала base-версии Ling-3.0-tiny и Ling-3.0-flash вместе с весами на ключевых стадиях обучения. На каждую модель приходится три checkpoint, всего их шесть.
Первый сохранен после масштабного предобучения, но до промежуточного обучения, WSM-слияния и постобучения. Второй прошел промежуточное обучение, но еще не WSM и постобучение. Третий получен после WSM-слияния и также не проходил постобучение.
Ling-3.0-tiny-base содержит 7,9 млрд параметров, из которых активируются 1,3 млрд. У Ling-3.0-flash-base 124 млрд общих и 5,1 млрд активных параметров. Веса доступны через Hugging Face и ModelScope.
Сама Ant предлагает использовать checkpoints для continued pretraining, доменного supervised fine-tuning, оптимизации предпочтений, обучения с подкреплением, дистилляции, а также исследований длинного контекста и MoE-систем. Это base-модели, а не готовые чат-боты: разработчик отдельно отвечает за постобучение, выравнивание, тестирование и проверку под конкретную задачу.
Есть важное ограничение. IT Home называет модели открытыми и приводит ссылки на репозитории, но в доступном описании не указывает конкретную лицензию. Поэтому по этому источнику нельзя сделать вывод, на каких именно условиях разрешено коммерческое использование. Перед продуктовой ставкой придется читать карточки репозиториев, а не довольствоваться словом open source в новости.
Ценность не в tiny
Раньше история Ling-3.0 выглядела как знакомая гонка за более удобным развертыванием. Для flash Ant предлагала API, локальный запуск квантованных версий на NVIDIA DGX Spark и высокопроизводительный вариант. Tiny позиционировалась как модель для дешевого локального инференса, в том числе на DGX Spark и Apple Silicon.
Новый релиз переносит разговор с инференса на обучение. Готовая base-модель обычно навязывает разработчику уже завершенный маршрут: общие данные, промежуточное обучение, выбранную процедуру стабилизации весов. Дальше остается адаптировать получившийся фундамент. Ant теперь позволяет зайти раньше и оспорить часть этого маршрута.
Команда с хорошим доменным корпусом может начать с checkpoint до промежуточного обучения и раньше изменить состав данных. Другая команда может взять состояние после mid-training, самостоятельно исследовать слияние весов и сравнить результат с готовой base-версией. Наличие нескольких состояний одной архитектуры делает такие сравнения чище: меняется этап обучения, а не вся модель сразу.
Особенно интересен WSM, которым Ant заменила традиционное снижение learning rate после промежуточного обучения. По заявлению разработчика, отсутствие этого снижения делает base-модель удобнее для continued pretraining и динамического расширения данных, а разные кривые снижения можно исследовать офлайн через взвешенное слияние checkpoints.
Для бизнеса это не бесплатная специализация. Ранний checkpoint может потребовать больше обучения, чем финальная база, а доменные данные способны как улучшить нужный навык, так и испортить остальные. Выигрывают команды, у которых уже есть корпус, инфраструктура оценки и гипотеза о том, на каком этапе вмешиваться. Остальным Ant просто выдала больше рычагов, а рычаг без стенда остается дорогой деталью.
Что смотреть дальше
Главный маркер появится не в новых бенчмарках Ant, а в сравнительных экспериментах сообщества. Нужны результаты, где одну и ту же доменную задачу обучают от раннего checkpoint, от mid-training и от финальной base-модели, а затем сопоставляют вычислительный бюджет и итоговое качество.
Если раннее добавление доменных данных даст тот же результат при меньших затратах, промежуточные веса станут практическим инструментом для небольших команд. Если выигрыш проявится только при больших бюджетах и сложном WSM, релиз останется хорошим исследовательским набором, но не короткой дорогой к собственной модели.