К содержанию
Выпуск №81 · 28 августа 2026 / Новости

LMCache использует 4-битное KV-кэширование для агентов с длинным контекстом на AMD MI355X

Как сообщает AMD ROCm Blogs, LMCache сочетает 4-битное KV-кэширование с выгрузкой квантованных данных KV за пределы HBM на AMD MI355X.

Редакция 28 августа 2026 г., 22:37 MSK

В Telegram

Как сообщает AMD ROCm Blogs, LMCache сочетает 4-битное KV-кэширование с выгрузкой квантованных данных KV за пределы HBM на AMD MI355X. Решение рассчитано на агентов, которые переносят всё более длинный контекст между последовательными запросами. В таких сценариях первым исчерпывается ресурс KV-кэша.

Нагрузка на память снижается сразу двумя способами. Квантование KV сокращает размер каждого сохранённого токена, а иерархический кэш LMCache переносит неактивные данные KV в CPU DRAM. Раньше эти методы в основном развивались независимо друг от друга.

Ключевые факты

  • Квантование KV уменьшает размер каждого сохранённого токена.

  • LMCache выгружает неактивные данные KV в CPU DRAM.

  • Квантование KV и иерархическое кэширование преимущественно развивались независимо друг от друга.

Вопросы и ответы

Для каких сценариев рассчитан этот подход?

Для ИИ-агентов, которые переносят длинный контекст между последовательными запросами и первыми упираются в лимит KV-кэша.

Как именно снижается нагрузка на память?

4-битное квантование уменьшает размер каждого сохранённого токена, а LMCache выгружает неактивные данные KV из HBM в CPU DRAM.

Чем решение отличается от прежних подходов?

На AMD MI355X квантование KV объединено с иерархическим кэшированием LMCache; ранее эти два метода преимущественно развивались независимо.

Контекст по теме

Как процитировать

«LMCache использует 4-битное KV-кэширование для агентов с длинным контекстом на AMD MI355X». hegai.media, 28 августа 2026 г.. https://hegai.media/novosti/lmcache-ispolzuet-4-bitnoe-kv-keshirovanie-dlya-agentov-s-dlinnym-kont--69158a07-d50f-4e69-a673-556dfcd65264

так материал выглядит в мессенджере