К содержанию
Выпуск №22 · 30 июня 2026 / Новости

NVIDIA заявила о снижении стоимости токенов на Blackwell за счет inference-стека

NVIDIA заявила, что по мере перехода компаний от пилотных ИИ-проектов к промышленной эксплуатации главным показателем инфраструктуры становится стоимость токена: сколько полезных токенов можно получить на доллар, ватт и при заданной задержке.

Редакция 30 июня 2026 г., 19:31 MSK

В Telegram

NVIDIA заявила, что по мере перехода компаний от пилотных ИИ-проектов к промышленной эксплуатации главным показателем инфраструктуры становится стоимость токена: сколько полезных токенов можно получить на доллар, ватт и при заданной задержке. Как пишет NVIDIA Blog, программный inference-стек компании, разработанный вместе с GPU, CPU, сетевыми решениями и системами NVIDIA, за месяц снизил стоимость токенов для модели DeepSeek V4 на платформе Blackwell до 5 раз.

В NVIDIA объясняют результат сочетанием нескольких уровней оптимизации. Речь идет об управлении распределенным inference, autoscaling и памятью, runtime-оптимизациях, а также доступе к возможностям GPU и сетевой инфраструктуры. В компании также утверждают, что комбинация disaggregated serving, large expert parallelism через NVIDIA NVLink, NVFP4 precision и multi-token prediction способна увеличить throughput до 20 раз.

Этот стек уже используют несколько компаний в рабочих сценариях. Baseten применила библиотеку NVIDIA TensorRT-LLM для обслуживания DeepSeek V4 Pro на Blackwell GPU и сообщила о росте производительности до 50% по числу токенов в секунду. Cognition использует NVIDIA Dynamo для управления inference-GPU в задачах reinforcement learning. Deep Infra и Together AI, в свою очередь, задействуют стек NVIDIA для запуска open source-моделей и production-сервисов на Blackwell, включая DeepSeek V4 и инфраструктуру для Cursor.

Ключевые факты

  • NVIDIA заявила о снижении стоимости токенов для DeepSeek V4 на платформе Blackwell до 5 раз за один месяц

  • Baseten сообщила о росте производительности до 50% по числу токенов в секунду при использовании NVIDIA TensorRT-LLM

  • NVIDIA утверждает, что сочетание disaggregated serving, NVLink, NVFP4 precision и multi-token prediction может увеличить throughput до 20 раз

  • Cognition использует NVIDIA Dynamo для управления inference-GPU в задачах reinforcement learning

Как процитировать

«NVIDIA заявила о снижении стоимости токенов на Blackwell за счет inference-стека». hegai.media, 30 июня 2026 г.. https://hegai.media/novosti/nvidia-zayavila-o-snizhenii-stoimosti-tokenov-na-blackwell-za-schet-in--4555c292-ddb8-41b3-9bdf-001bfef0f6de

так материал выглядит в мессенджере