Стоимость минимальной инфраструктуры для локального запуска LLM за год выросла в 2,8 раза, подсчитала MWS Cloud. Для бизнеса это сигнал срочно обновить расчёты, но не готовый коэффициент для бюджета: в выборке изменились и цены оборудования, и сами модели, которым теперь нужно больше памяти и более производительные GPU.
Главная практическая ошибка сейчас будет выглядеть так: взять прошлогоднюю конфигурацию, умножить её цену на 2,8 и назвать результат новым TCO. Исследование такой арифметики не подтверждает.
Что именно подорожало
Как пишет CNews, MWS Cloud сравнила популярные открытые модели, выпущенные весной и летом 2025 и 2026 годов. Средняя стоимость минимального набора ускорителей Nvidia для запуска одной модели выросла с 13,7 млн до 38,8 млн рублей.
Расчёт сделан для минимального числа видеокарт, необходимого, чтобы запустить модель и обработать один запрос максимального заявленного размера. В стоимость вошли серверы с GPU и коммутаторы к ним.
Это важная граница расчёта. Речь не о полноценном производственном контуре с заданной нагрузкой, резервированием и сроком окупаемости, а о минимальном билете на вход. Даже этот билет стал почти втрое дороже, но реальная инфраструктура конкретной компании может отличаться от него сильнее, чем хотелось бы финансовому директору.
Причин роста в публикации две. Новые LLM лучше справляются со сложными задачами и учитывают больше информации в одном запросе, поэтому требуют больше памяти и более производительных GPU. Одновременно дорожают сами видеокарты. Павел Воронин, генеральный директор MWS, связывает динамику российского рынка с глобальным спросом на вычислительные мощности: гонка в области ИИ поддерживает рост стоимости ускорителей по всему миру.
Поэтому назвать коэффициент 2,8 чисто российской наценкой нельзя. Но и отделить глобальное подорожание от российских условий по этим данным невозможно. CNews называет в составе расчёта серверы с GPU и коммутаторы, однако не приводит отдельной декомпозиции по цене ускорителей, логистике, валютной составляющей, лицензиям или другим возможным расходам. Цифра показывает итог для выбранной методики, а не объясняет каждую строку счёта поставщика.
Модели стали тяжелее, а сравнение стало сложнее
Наборы моделей за два года различаются. В выборку 2025 года вошли Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и Cotype Pro 2. Для 2026 года MWS Cloud взяла Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.
Иными словами, исследование сравнивает не одну и ту же модель на одном и том же железе через год. Оно сравнивает минимальную инфраструктуру для двух поколений актуальных моделей. Коэффициент 2,8 отражает одновременно инфляцию GPU-бюджета и изменение требований рынка к тому, что считается современной LLM.
Для оператора это даже полезнее чистого индекса цен. Если продукт действительно требует новых моделей и максимального контекста, старая смета устарела технологически, а не только финансово. Если же бизнес-задачу закрывает более компактная модель, платить весь коэффициент необязательно. Само исследование называет три реакции компаний на дорогую инфраструктуру: выбирать меньшие модели, оптимизировать вычисления или переходить в облако с оплатой фактически используемых мощностей.
Китайские ускорители пока не дают универсальной запасной двери. MWS Cloud подтверждает возможность запуска на Huawei Ascend 910B не для всех рассмотренных LLM: для трёх из шести моделей в выборке 2025 года и пяти из семи в 2026 году. Среднее требуемое число таких ускорителей выросло с 10,7 до 13,6. Официальной цены нет, оценка составляет от половины до двух третей стоимости сопоставимых GPU Nvidia. Экономия выглядит заметной, но совместимость всё ещё приходится проверять модель за моделью.
Что пересчитать до закупки
Сейчас владельцу локального контура нужен не один обновлённый бюджет, а минимум три сопоставимых сценария: покупка серверов, аренда GPU и использование модели через облако. Для каждого стоит заново проверить размер модели, максимальный контекст, реальную нагрузку и требуемый запас мощности. Иначе компания рискует купить дорогую способность обрабатывать предельный запрос, который её продукт почти никогда не отправляет.
Спрос уже движется в сторону потребления без покупки собственного железа. По оценке MWS Cloud, в первом полугодии 2026 года российские компании использовали китайские LLM на платформах MWS GPT Model Hub и MWS GPT более чем в 11 раз активнее, чем за весь 2025 год. Это ещё не доказывает отказ рынка от локальных контуров, но показывает, где компании ищут альтернативу капитальным затратам.
Маркер на ближайшие месяцы: коммерческие предложения на одинаковую конфигурацию и доля проектов, которые после расчёта TCO уходят с покупки GPU в аренду или облако. Если разрыв между этими сценариями продолжит расти, суверенный инференс останется не стандартным выбором, а дорогой опцией для задач, где контроль над контуром действительно окупает железо.