Как сообщает AWS Machine Learning Blog, открытую модель NVIDIA Nemotron 3.5 Lightning теперь можно развернуть через Amazon SageMaker JumpStart. Самостоятельно настраивать обслуживающую инфраструктуру не потребуется. Модель рассчитана на высоконагруженные агентные сценарии и обучена работе с инструментами в популярных агентных средах.
В основе Nemotron 3.5 Lightning лежит гибридная архитектура Mixture-of-Experts. Всего у модели 30B параметров, но при каждом прямом проходе активируются только 3B. Она поддерживает контекст до 1M токенов, использует спекулятивное декодирование DFlash и способна работать на одном поддерживаемом GPU. По заявлению NVIDIA, пропускная способность может быть до 4 раз выше, а выполнение задач в высоконагруженных агентных сценариях завершается до 30% быстрее.
Модель дистиллировали из NVIDIA Nemotron 3 Ultra и разработали совместно с Nemotron Coalition. В системах с несколькими моделями Lightning можно поручить специализированные операции с большим числом вызовов. Например, классификацию предупреждений, извлечение полей из форм или проверку записей на соответствие правилам. Планирование многоэтапных процессов при этом можно оставить моделям передового уровня.
Ключевые факты
Из 30B параметров модели при каждом прямом проходе активируются 3B.
Контекстное окно достигает 1M токенов, а для спекулятивного декодирования используется DFlash.
NVIDIA заявляет до 4 раз более высокую пропускную способность и до 30% более быстрое завершение задач.
Модель может работать на одном поддерживаемом GPU.
Вопросы и ответы
- Что изменится в развертывании модели?
Nemotron 3.5 Lightning можно запустить через SageMaker JumpStart без самостоятельной настройки обслуживающей инфраструктуры; для работы достаточно одного поддерживаемого GPU.
- Для каких задач ее имеет смысл использовать?
Модель рассчитана на высоконагруженные агентные операции с большим числом вызовов, включая классификацию предупреждений, извлечение полей из форм и проверку записей по правилам. Планирование многоэтапных процессов предлагается оставлять моделям передового уровня.
- За счет чего модель должна работать быстрее?
При общем размере 30B параметров на каждом проходе активируются только 3B, а для спекулятивного декодирования применяется DFlash. NVIDIA заявляет до 4 раз более высокую пропускную способность и до 30% более быстрое завершение задач.
Контекст по теме
- Amazon Bedrock в AWS GovCloud (US) получил модели OpenAI GPT OSS и NVIDIA Nemotron1 июля 2026 г.
- NVIDIA выпустила Nemotron-Labs-TwoTower, diffusion-модель с открытыми весами на базе Nemotron-3-Nano-30B-A3B1 июля 2026 г.
- NVIDIA представила языковую модель Nemotron-TwoTower-30B-A3B-Base-BF16 с диффузионной генерацией текста25 июня 2026 г.
- HPE AI Factory добавляет функции для работы с агентами16 июня 2026 г.