К содержанию
Выпуск №98 · 14 сентября 2026 / Новости

AWS показала, почему дешёвая ИИ-модель может обходиться дороже

Компания опубликовала код для сравнения стоимости правильного ответа. В её тесте модель с более дорогими токенами оказалась дешевле по результату, но разные настройки ограничивают вывод.

Редакция 14 сентября 2026 г., 15:25 MSK

В Telegram

AWS опубликовала открытый набор тестов для выбора ИИ-моделей по стоимости выполненной задачи. Он сравнивает пять моделей и учитывает то, чего нет в прайс-листе: ошибки, длину ответа и число шагов агента. Код доступен в репозитории openai-on-aws/benchmarks-openai.

Для бизнеса здесь полезна сама единица расчёта. AWS делит расходы на все попытки, включая неудачные, на число правильных ответов. В продукте похожим образом можно считать стоимость обращения, которое поддержка закрыла без помощи человека. Цена токена тогда становится одним из множителей, а не главным критерием закупки.

Что получилось в тестах

В исследовании AWS модели gpt-5.6-luna, terra и sol работали через Amazon Bedrock, а gpt-5.4-mini и nano — через OpenAI API. На математических задачах AIME luna ещё до снижения тарифа обходилась на 25% дешевле за правильный ответ, хотя её номинальная цена была примерно в полтора раза выше, чем у mini. По объяснению AWS, разницу обеспечило меньшее число оплачиваемых токенов.

С учётом снижения цен 30 июля авторы получили $0,0021 за правильный ответ у luna против $0,0139 у mini. Это расходы в конкретном эксперименте, а не обещанная стоимость работы в другом продукте.

У сравнения есть существенное ограничение: модели в Bedrock запускались с отключённым reasoning, а mini и nano — с настройками по умолчанию. Выборки содержали от 48 до 198 заданий. Из этих результатов нельзя заключить, что одна модель всегда выгоднее другой: AWS сравнила разные рабочие конфигурации, а не изолированное качество моделей.

Что это меняет для владельца продукта

У агентов разрыв между тарифом и счётом может быть ещё больше. В тесте AWS каждый новый шаг повторно отправлял накопленную историю. Поэтому лишний шаг добавлял не только новый ответ, но и повторную оплату контекста.

Перед выбором поставщика можно прогнать несколько моделей на одинаковых задачах своего продукта. Считать стоит полные расходы на принятый результат, включая неудачные попытки. Рядом нужны ещё две метрики: время выполнения и доля задач, которые пришлось передать человеку. Более дорогая модель выгодна, если итоговая стоимость снижается без ухудшения этих показателей.

Как процитировать

«AWS показала, почему дешёвая ИИ-модель может обходиться дороже». hegai.media, 14 сентября 2026 г.. https://hegai.media/novosti/aws-pokazala-pochemu-deshevaya-ii-model-mozhet-obhoditsya-dorozhe--307f5a4c-ddcd-4ba8-80b4-474180fdf4b1

так материал выглядит в мессенджере