Измерения на Apple Silicon показали, что крупные локальные LLM могут быть дешевле в эксплуатации, чем меньшие модели
Автор эксперимента с локальными LLM протестировал пять моделей на Mac Studio с M3 Ultra и 96 ГБ объединённой памяти, чтобы оценить реальную стоимость генерации токенов через энергопотребление. Как пишет Towards Data Science, расчёты строились на фактическом тарифе $0,31 за кВт·ч. Для проверки использовали не только встроенные датчики Apple Silicon, но и внешний измеритель энергии Shelly Plug US Gen4.
Тесты проходили в режиме непрерывной генерации токенов в течение 120, 360 и 720 секунд. Для каждого сценария проводили по три прохода. Автор задействовал собственный инструмент TokenWatt: он измеряет энергопотребление через интерфейс Apple IOReport и сопоставляет результаты с замерами «из розетки». Погрешность измерений в итоговых данных составила от ±2,6% до ±4,5%.
Главный вывод эксперимента заключается в том, что стоимость работы модели не связана напрямую с количеством параметров. По данным автора, модель на 120 млрд параметров оказалась примерно в пять раз дешевле по стоимости токена, чем dense-модель на 27 млрд параметров. В материале также отмечается, что ключевым фактором оказалась скорость генерации токенов, а не размер модели.
Ключевые факты
Эксперимент проводился на Mac Studio с M3 Ultra и 96 ГБ объединённой памяти без дискретного GPU
Измерения выполнялись для пяти моделей в циклах генерации по 120, 360 и 720 секунд с паузой 15 минут между сериями
TokenWatt использует интерфейс Apple IOReport и калибрует данные по внешнему измерителю Shelly Plug US Gen4
Погрешность итоговых измерений составила от ±2,6% до ±4,5%
Вопросы и ответы
- Насколько сильно стоимость генерации зависит от размера модели на практике?
В эксперименте модель на 120 млрд параметров оказалась примерно в пять раз дешевле по стоимости токена, чем dense-модель на 27 млрд параметров. Автор связывает это прежде всего со скоростью генерации токенов, а не с числом параметров.
- На каком железе и по какому тарифу считали реальную стоимость токенов?
Тесты проводились на Mac Studio с M3 Ultra и 96 ГБ объединённой памяти без дискретного GPU. Стоимость рассчитывалась по фактическому тарифу $0,31 за кВт·ч с проверкой данных через внешний измеритель Shelly Plug US Gen4.
- Насколько надёжны результаты измерений энергопотребления?
Измерения выполнялись сериями по 120, 360 и 720 секунд с паузой 15 минут и тремя проходами для каждого сценария. TokenWatt использовал Apple IOReport и сверял данные с замерами «из розетки», итоговая погрешность составила от ±2,6% до ±4,5%.
Контекст по теме
- Numerama протестировало локальную ИИ-систему с двумя GPU AMD без использования облака1 июля 2026 г.
- Как запускать крупные LLM на видеокартах с 4–12 ГБ VRAM: практические приёмы локального инференса23 июня 2026 г.
- Локальные LLM и ограничения памяти: почему 16 ГБ ОЗУ на разных компьютерах, не одно и то же19 июня 2026 г.
- Стоимость электроэнергии влияет на размещение AI‑дата‑центров в Китае15 июня 2026 г.