OpenAI выпустила режим GPT-6 Astra Ultrafast: по данным NVIDIA, он генерирует токены, небольшие фрагменты текста, до восьми раз быстрее Astra Standard. Режим уже доступен через OpenAI API, программный интерфейс для подключения модели, а также части пользователей ChatGPT Work и Codex.
Ускорение обеспечивают графические процессоры NVIDIA Blackwell и оптимизация инференса, то есть процесса, во время которого готовая модель формирует ответ. NVIDIA пишет, что выигрыш особенно заметен в длинных цепочках: агент пишет код, запускает инструмент, проверяет результат, исправляет ошибку и повторяет цикл. Чем больше таких шагов, тем сильнее суммарный эффект от сокращения каждой паузы.
Цифры у площадок различаются, потому что они описывают разные показатели. NVIDIA заявляет ускорение генерации токенов до восьми раз относительно Astra Standard. Amazon, которая добавила Ultrafast в Bedrock, приводит данные OpenAI: до шестикратного ускорения работы через API и скорость до 300 токенов в секунду. AWS предлагает использовать режим для кодовых помощников, интерактивных агентов и сервисов, отвечающих пользователям в реальном времени. Цена Ultrafast в источниках не указана.
Релиз вышел на фоне попыток OpenAI превратить агентов в рабочий инструмент для длительных задач. Днём ранее компания запустила Dots, где агент на GPT-6 Astra работает на отдельной облачной машине, а AWS открыла превью инфраструктуры для хранения состояния и контроля действий агентов. Ultrafast решает другую часть той же задачи: убирает ожидание между последовательными действиями модели.
Что это значит
- Для вас. Разработчики с доступом к API смогут ускорить циклы написания, проверки и исправления кода. В обычном чате разница может быть менее заметна, чем в агенте, который за одну задачу десятки раз обращается к инструментам.
- В России. OpenAI API и ChatGPT напрямую не работают, российские карты не принимаются. Подключение возможно через посредников или зарубежное юрлицо; AWS не принимает новых клиентов из России. Альтернативы: DeepSeek, Qwen и Llama на своих серверах или в российском облаке, а также GigaChat и YandexGPT.
- Что сделать. Перед переходом стоит измерить полное время реальных сценариев, включая вызовы инструментов, а не только скорость появления текста. Стоимость Ultrafast пока неизвестна, поэтому оценить экономику режима по опубликованным данным нельзя.
- За чем следить. Главный маркер: цена Ultrafast и фактическая задержка в многошаговых задачах. Именно они покажут, станет ли режим массовым или останется премиальным вариантом для приложений, где важна каждая секунда.

