Российский инференс заметно подешевел, поэтому бюджеты, собранные на прошлогодних тарифах, уже устарели. Но переносить нагрузку только из-за новой цены рано: разница между дешевым токеном и дешевым рабочим результатом легко съедается повторными запросами, длинными промптами и переключением на более сильную модель.
Что именно подешевело
По исследованию Nodul, которое приводит РБК Тренды, с октября 2025 года по август 2026-го цена 1 тыс. токенов GigaChat Lite снизилась на 67,5%, с 0,20 до 0,065 руб. В линейке GigaChat Pro падение составило 66,7%, с 1,50 до 0,50 руб.
YandexGPT Pro 5.1 стоит 0,80 руб. за 1 тыс. токенов, на 33% меньше предыдущей версии YandexGPT 5 Pro. YandexGPT Lite не подешевел: его тариф остался на уровне 0,20 руб.
Представители «Яндекса» и «Сбера» считают, что фактическое снижение сильнее оценки Nodul, а прямое сравнение с иностранными моделями некорректно. Это разумное возражение, если модели отличаются по качеству и условиям доступа. Но для покупателя оно не отменяет калькулятор.
Чтобы привести тарифы хотя бы к одной арифметике, возьмем запрос с 1 тыс. входных и 1 тыс. выходных токенов. Если указанные для российских моделей единые ставки одинаково применяются к входу и выходу, GigaChat Lite обойдется в 0,13 руб., GigaChat Pro в 1 руб., YandexGPT Lite в 0,40 руб., YandexGPT Pro 5.1 в 1,60 руб.
У иностранных моделей из исследования вход и выход тарифицируются отдельно. Для той же пропорции DeepSeek V4 Flash будет стоить около 0,1495 руб., GPT-5.4 mini около 0,447 руб., Qwen 3.8 Max около 0,681 руб. Это не рейтинг качества и не готовый ответ на вопрос о поставщике. Зато видно, что тезис «зарубежные модели всегда дешевле» не работает без структуры запроса: в условном сценарии один к одному GigaChat Lite номинально дешевле всех трех приведенных вариантов. Для локальных Pro-моделей картина обратная.
Где тариф превращается в экономию
Для суммаризации, классификации, извлечения полей и коротких ответов снижение цены GigaChat Lite уже достаточно велико, чтобы повторить тесты. Не обязательно мигрировать весь контур. Практичнее отдать дешевой модели часть однотипного трафика, а сложные или не прошедшие проверку запросы направлять в текущую модель.
Так появляется маршрутизация по экономике, а не по логотипу. Ее ключевая метрика выглядит так: все расходы на генерацию и повторные попытки делятся на число ответов, которые продукт действительно принял. Если модель вдвое дешевле, но чаще требует второго запроса или обращения к резервной модели, скидка существует только в прайс-листе.
Приведенных в пакете тарифных данных недостаточно, чтобы оценить лимиты запросов, длину контекста, стабильность задержки и качество на конкретных задачах. Поэтому честно посчитать скрытые расходы по этому пакету нельзя. Их придется достать из собственного пилота: измерить среднюю длину входа и выхода, число повторов, долю успешных ответов и стоимость резервного маршрута.
Это особенно важно на фоне общей экономики внедрения. CNews приводил оценку MWS Cloud: средняя стоимость развертывания ведущих больших языковых моделей в России летом 2026 года выросла до 38,8 млн руб. против 13,7 млн руб. годом ранее. Дешевеющий инференс не отменяет расходов на инфраструктуру и внедрение. Он лишь снижает переменную часть счета.
Рынок к такому пересчету уже пришел. 3DNews писал, что в июне индекс расходов пользователей на токены снизился почти на 20% от майского максимума, а OpenAI урезала цены небольших моделей вплоть до 80%. Одновременно Gartner предупреждал о противоположном эффекте: переход ИИ-агентов с фиксированной оплаты на токены способен резко увеличить итоговый счет. Токен дешевеет, но продукт учится потреблять их больше. Удобный фокус для бюджета, если смотреть только на тариф.
Что смотреть дальше
Главный маркер не следующий раунд снижения цен, а стоимость 1 тыс. принятых бизнесом результатов на небольшом участке реального трафика. Если после подключения GigaChat Lite или маршрутизации между Lite и Pro эта цифра устойчиво падает вместе с числом обращений к резервной модели, перенос нагрузки оправдан. Если уменьшается только строка «цена токена», а общий счет остается прежним, значит, поставщик подешевел, а ваш ИИ-контур нет.
