К содержанию

Разбор · Рынок

Почему ИИ-модели дешевеют и сколько бизнес платит за результат

OpenAI снизила API-тарифы вдвое, Anthropic обещает экономию 40%, а Xiaomi предлагает сильную открытую модель дешевле доллара за миллион токенов.

В Telegram
Штаб-квартира Xiaomi в Пекине
Архивное фото: Штаб-квартира Xiaomi в ПекинеN509FZ / Wikimedia Commons, CC BY-SA 4.0 · Лицензия

За миллион токенов нейросети теперь можно заплатить от нескольких центов до десятков долларов, однако эта цифра почти ничего не говорит о бюджете корпоративного ИИ-агента. Модель с дешёвым тарифом может чаще ошибаться и повторять работу, а дорогая иногда окупается с первой попытки. Поэтому считать пора стоимость результата, включая неудачные запросы, инфраструктуру и контроль человека.

Как OpenAI, Anthropic, Xiaomi и DeepSeek начали спорить ценой

13 августа DeepSeek объявила о повышении тарифов на модели V4 с 16 августа. В часы пик цена генерации выросла более чем в четыре раза. Компания объяснила динамическое ценообразование необходимостью разумнее распределять вычислительные ресурсы и предложила вдвое более низкие ставки в менее загруженные часы, пишет Fortune.

The Information сообщило, что выручка DeepSeek в годовом выражении достигла $1 млрд против менее $500 млн несколькими месяцами ранее. Это расчёт на основе текущего темпа, а не уже полученная за год сумма. По данным издания, рост поддержали новые тарифы и сохраняющаяся популярность моделей.

22 сентября сразу несколько производителей пошли в обратную сторону. OpenAI выпустила GPT-6 Sol для сложной повторяющейся работы и GPT-6 Luna для массовых задач вроде извлечения данных и составления кратких пересказов. Обе модели появились в API, то есть интерфейсе для подключения модели к другим программам, и получили тарифы как минимум на 50% ниже цен GPT-5.6.

В тот же день Anthropic представила Claude Opus 5.5. Компания утверждает, что на типичных нагрузках модель обходится на 40% дешевле Opus 5, генерирует ответ более чем на 30% быстрее и при этом на большинстве задач работает на уровне более мощной Claude Fable 5.1. TechCrunch отмечает, что предыдущая Opus 5 вышла всего двумя месяцами раньше, 24 июля.

Xiaomi выпустила MiMo-V2.6-Pro и более дешёвую MiMo-V2.6-Flash. VentureBeat называет Pro лидером среди моделей с открытыми весами в рейтинге Artificial Analysis. Открытые веса означают, что параметры модели можно скачать и запустить на собственной инфраструктуре. Xiaomi распространяет модель по лицензии MIT, которая разрешает коммерческое использование и модификацию.

Причина синхронного снижения цен проста: компании уже выбирают модели не только по максимальному результату тестов. По данным CNBC, доля китайских моделей на платформе OpenRouter выросла с 6–13% использованных токенов в феврале до 57–67% в неделю с 14 сентября. На Vercel рост составил с 11% в январе до 55% в августе. Как только дешёвая модель достигает приемлемого качества, переплата за самый известный бренд начинает выглядеть расточительством.

Почему тариф за токены не равен стоимости работы

Токеном называется небольшой фрагмент текста, который модель получает или генерирует. Провайдеры обычно отдельно считают входные токены, выходные токены и обращения к кэшу, где сохраняется уже обработанный контекст. Инференс, то есть выполнение обученной модели ради ответа, тарифицируется по объёму этих операций.

Для простого чат-бота этого расчёта иногда достаточно. Корпоративный агент работает иначе: читает документы или код, вызывает внешние инструменты, возвращается к предыдущим шагам, проверяет результат и пробует снова после ошибки. Агентный процесс может включать десятки шагов.

DoiT пишет, что агентные задачи способны потреблять в тысячу раз больше токенов, чем обычный чат о программировании. Даже два запуска одной модели на одинаковой задаче могут различаться по расходу токенов в 30 раз. При этом больший расход сам по себе не гарантирует более точного ответа.

Поэтому рабочая метрика выглядит так: все расходы на попытки, инструменты, проверку и исправления делятся на число успешно завершённых задач. В сумму входят неудачные ответы, повторные вызовы, обращения к другим моделям, вычислительная инфраструктура и, если результат нужно проверять вручную, время сотрудника.

Исследователи T2MO предлагают сначала разделить рабочие запросы по типу и сложности, затем проверить модели в условиях, близких к реальным, и отправлять каждую задачу самой дешёвой модели, которая укладывается в требования к качеству и скорости. Если дешёвая модель не справляется и запрос приходится передавать дорогой, стоимость такой эскалации учитывается заранее.

Пример показывает, почему дополнительные расходы иногда полезны. В исследовании программ для физики добавление базы знаний, примеров и автоматического исправления повысило долю успешных первых попыток Claude Code с 58,5% до 76%. Итоговый успех вырос с 90,5% до 96%, а средняя стоимость успешно выполненной задачи увеличилась лишь на 1,3%. Небольшая доплата за контекст сократила число провалов.

Сколько стоят новые модели и успешная задача

Ниже указаны цены API за миллион токенов. Входом считается переданный модели текст и контекст, выходом служит сгенерированный ответ.

МодельВходВыходЧто изменилось
GPT-6 Luna$0,10$0,50Вход вдвое дешевле GPT-5.6 Luna, выход дешевле на 58,3%
MiMo-V2.6-Flash$0,14$0,28Дешёвая модель Xiaomi для массовых нагрузок
MiMo-V2.6-Pro$0,435$0,87Открытые веса и лицензия MIT
DeepSeek-V4-FlashНе указано$1,32 в пикВыход подорожал с $0,28; вне пика цена вдвое ниже
GPT-6 Sol$2$10Вдвое дешевле GPT-5.6 Sol
DeepSeek-V4-ProНе указано$3,96 в пикРанее выход стоил $0,87; вне пика цена вдвое ниже
Claude Opus 5.5$4$20Токены дешевле Opus 5 на 20%, кэш дешевле на 60%

У DeepSeek опубликованные Fortune ставки относятся к миллиону выходных токенов; отдельная цена входа в источнике не приведена. Для Claude Opus 5.5 чтение миллиона токенов из кэша стоит $0,20. Anthropic говорит, что кэш составляет большую часть расходов в программировании и агентных сценариях, поэтому общая экономия на типичной нагрузке достигает 40%, хотя базовый тариф снизился на 20%.

У Xiaomi показатель Artificial Analysis для MiMo-V2.6-Pro составил $0,13 за тестовую задачу, скорость генерации около 134 токенов в секунду. Однако сравнивать эту цифру напрямую с бюджетом своего продукта нельзя: тестовый сценарий и реальный агент могут совершать разное число вызовов и использовать разные инструменты.

Эксперимент Arize и Fireworks охватил 40 агентных задач, 10 моделей и 2400 запусков. Открытая gpt-oss-120b успешно решала только 33% задач, но одна удача в среднем стоила $0,054. Это оказалось примерно в 12 раз дешевле GPT-5.5 и в 23 раза дешевле Gemini 3.5 Flash с учётом повторов.

На простых задачах Kimi K2.6 показала 73% успешных запусков, GPT-5.5 дала 69%, а gpt-oss-120b достигла 65% при стоимости одной попытки примерно в 24 раза ниже. На сложных заданиях дешёвые модели резко теряли эффективность. Четвёртый повтор обычно не помогает системе, которая в принципе не умеет решить задачу, зато исправно увеличивает счёт.

Кто экономит на маршрутизации, а кто оплачивает ошибки

Главные выгодополучатели ценовой конкуренции: компании с большим потоком однотипных запросов. Извлечение полей из документов, классификацию обращений и короткие пересказы можно отправлять GPT-6 Luna, MiMo-Flash или другой небольшой модели. Более сложный анализ и программирование получают Sol, Opus или модель сходного класса. Самые трудные задачи остаются за флагманами.

Такой подход называют маршрутизацией: система определяет тип и сложность запроса, затем выбирает подходящую модель. GitHub уже показывает эту логику пользователю Copilot: Luna позиционируется как самый дешёвый вариант семейства GPT-6, а Sol как сбалансированная модель для интерактивного и агентного программирования.

Разработчики открытых моделей выигрывают там, где заказчику важны контроль данных и возможность менять систему. MiMo-V2.6-Pro можно дообучить и запустить на собственном или арендованном оборудовании без оплаты Xiaomi за каждый токен. Но бесплатные веса не означают бесплатную эксплуатацию: компании всё равно нужны вычислительные мощности, специалисты, мониторинг и обновления.

Платят прежде всего команды, которые выбирают модель по одной строке прайс-листа. Слабая модель может чаще вызывать инструменты, возвращать неподходящий формат или отправлять задачу более дорогому исполнителю. Слишком мощная модель, поставленная на каждое простое действие, создаёт противоположную проблему: высокий тариф оплачивает возможности, которые процесс не использует.

Давление испытывают и сами лаборатории. Fortune называет происходящее ценовой войной OpenAI и Anthropic, которая помогает привлечь экономных корпоративных клиентов, но ограничивает потенциальную прибыль с каждого запроса. DeepSeek показывает другой вариант: дешёвый поставщик способен поднять цены более чем в четыре раза и продолжить расти, если его качество уже устраивает рынок.

Как российской компании посчитать бюджет ИИ

OpenAI и Anthropic напрямую не предоставляют ChatGPT, Claude и свои API клиентам из России, российские карты не принимаются. Компании подключаются через посредников-агрегаторов или зарубежное юрлицо.

Сайт и API DeepSeek открываются из России. Веса моделей опубликованы открыто, поэтому их можно разместить на собственных серверах или в российском облаке и не передавать данные за рубеж. MiMo-V2.6-Pro тоже распространяется с открытыми весами, однако доступность API Xiaomi и способы оплаты из России пока неизвестны.

Из российских альтернатив доступны GigaChat и YandexGPT. Для новых корпоративных клиентов GigaChat с 1 сентября 2026 года продаётся через Cloud.ru. Можно купить пакет токенов или платить по фактическому использованию по договору либо счёту-оферте. Цены выставляются в рублях с НДС, минимальный расход при наличии операций составляет 600 рублей в месяц. Если обращений к API не было, платёж не взимается. Асинхронный режим, где ответ не нужен немедленно, стоит дешевле синхронного.

Практичный расчёт начинается с выборки реальных задач. Для каждого типа нужно измерить расход входных, выходных и кэшированных токенов, долю успешных попыток, число повторов, обращения к инструментам и время проверки сотрудником. После этого сравнивается стоимость одной принятой задачи, а не искусственного миллиона токенов.

Для массового процесса разумно испытать несколько моделей параллельно: дешёвую для основного потока, более сильную для сложных запросов и резервную на случай отказа. Экономия в прайс-листе становится реальной только после такого теста. Иначе компания просто меняет дорогие токены на дешёвые ошибки.

Вопросы и ответы

Сколько стоит использование нейросети для бизнеса?

Цена API начинается примерно с $0,10 за миллион входных токенов у GPT-6 Luna и доходит до $20 за миллион выходных токенов у Claude Opus 5.5. Итоговый бюджет зависит от длины контекста, числа повторов, вызовов инструментов, инфраструктуры и проверки результатов человеком.

Почему дешёвая модель может обойтись дороже?

Она может чаще ошибаться, превышать лимит времени или передавать задачу более мощной модели. Все неудачные попытки оплачиваются, поэтому сравнивать нужно стоимость успешно завершённой задачи, а не только тариф за токен.

Можно ли пользоваться OpenAI и Claude в России?

OpenAI и Anthropic напрямую не обслуживают клиентов из России, а российские карты для оплаты не подходят. Компании используют посредников-агрегаторов или зарубежное юрлицо.

Какие ИИ-модели можно развернуть на своих серверах?

DeepSeek публикует открытые веса, а Xiaomi выпустила MiMo-V2.6-Pro по лицензии MIT. Такие модели можно разместить на собственной инфраструктуре или в российском облаке, но компания оплачивает серверы, эксплуатацию и работу специалистов.

Как выбрать модель для корпоративного ИИ-агента?

Сначала задачи делят по типу и сложности, затем несколько моделей проверяют на реальных примерах. Простые запросы отправляют дешёвой модели, сложные передают более мощной, а бюджет считают по числу принятых результатов с учётом повторов и контроля.

Какая российская альтернатива доступна компаниям?

Корпоративные клиенты могут использовать GigaChat API и YandexGPT. У GigaChat доступны пакеты токенов и оплата по фактическому использованию в рублях с НДС; минимальный расход при наличии операций составляет 600 рублей в месяц.

Как процитировать этот материал

«Почему ИИ-модели дешевеют и сколько бизнес платит за результат». hegai.media, 27 сентября 2026 г.. https://hegai.media/novosti/xiaomi-vypustila-otkrytuyu-ii-model-deshevle-1-za-million-tokenov--aecfb3c1-23fc-4126-bdf5-ab3b91e8ecbd