К содержанию
Новости

Измерения на Apple Silicon показали, что крупные локальные LLM могут быть дешевле в эксплуатации, чем меньшие модели

Измерения на Apple Silicon показали, что крупные локальные LLM могут быть дешевле в эксплуатации, чем меньшие модели

Автор эксперимента с локальными LLM протестировал пять моделей на Mac Studio с M3 Ultra и 96 ГБ объединённой памяти, чтобы оценить реальную стоимость генерации токенов через энергопотребление. Как пишет Towards Data Science, расчёты строились на фактическом тарифе $0,31 за кВт·ч. Для проверки использовали не только встроенные датчики Apple Silicon, но и внешний измеритель энергии Shelly Plug US Gen4.

Тесты проходили в режиме непрерывной генерации токенов в течение 120, 360 и 720 секунд. Для каждого сценария проводили по три прохода. Автор задействовал собственный инструмент TokenWatt: он измеряет энергопотребление через интерфейс Apple IOReport и сопоставляет результаты с замерами «из розетки». Погрешность измерений в итоговых данных составила от ±2,6% до ±4,5%.

Главный вывод эксперимента заключается в том, что стоимость работы модели не связана напрямую с количеством параметров. По данным автора, модель на 120 млрд параметров оказалась примерно в пять раз дешевле по стоимости токена, чем dense-модель на 27 млрд параметров. В материале также отмечается, что ключевым фактором оказалась скорость генерации токенов, а не размер модели.

Ключевые факты

  • Эксперимент проводился на Mac Studio с M3 Ultra и 96 ГБ объединённой памяти без дискретного GPU

  • Измерения выполнялись для пяти моделей в циклах генерации по 120, 360 и 720 секунд с паузой 15 минут между сериями

  • TokenWatt использует интерфейс Apple IOReport и калибрует данные по внешнему измерителю Shelly Plug US Gen4

  • Погрешность итоговых измерений составила от ±2,6% до ±4,5%

Вопросы и ответы

Насколько сильно стоимость генерации зависит от размера модели на практике?

В эксперименте модель на 120 млрд параметров оказалась примерно в пять раз дешевле по стоимости токена, чем dense-модель на 27 млрд параметров. Автор связывает это прежде всего со скоростью генерации токенов, а не с числом параметров.

На каком железе и по какому тарифу считали реальную стоимость токенов?

Тесты проводились на Mac Studio с M3 Ultra и 96 ГБ объединённой памяти без дискретного GPU. Стоимость рассчитывалась по фактическому тарифу $0,31 за кВт·ч с проверкой данных через внешний измеритель Shelly Plug US Gen4.

Насколько надёжны результаты измерений энергопотребления?

Измерения выполнялись сериями по 120, 360 и 720 секунд с паузой 15 минут и тремя проходами для каждого сценария. TokenWatt использовал Apple IOReport и сверял данные с замерами «из розетки», итоговая погрешность составила от ±2,6% до ±4,5%.

Контекст по теме