Как сообщает AMD ROCm Blogs, LMCache сочетает 4-битное KV-кэширование с выгрузкой квантованных данных KV за пределы HBM на AMD MI355X. Решение рассчитано на агентов, которые переносят всё более длинный контекст между последовательными запросами. В таких сценариях первым исчерпывается ресурс KV-кэша.
Нагрузка на память снижается сразу двумя способами. Квантование KV сокращает размер каждого сохранённого токена, а иерархический кэш LMCache переносит неактивные данные KV в CPU DRAM. Раньше эти методы в основном развивались независимо друг от друга.
Ключевые факты
Квантование KV уменьшает размер каждого сохранённого токена.
LMCache выгружает неактивные данные KV в CPU DRAM.
Квантование KV и иерархическое кэширование преимущественно развивались независимо друг от друга.
Вопросы и ответы
- Для каких сценариев рассчитан этот подход?
Для ИИ-агентов, которые переносят длинный контекст между последовательными запросами и первыми упираются в лимит KV-кэша.
- Как именно снижается нагрузка на память?
4-битное квантование уменьшает размер каждого сохранённого токена, а LMCache выгружает неактивные данные KV из HBM в CPU DRAM.
- Чем решение отличается от прежних подходов?
На AMD MI355X квантование KV объединено с иерархическим кэшированием LMCache; ранее эти два метода преимущественно развивались независимо.
Контекст по теме
- Qualcomm представила архитектуру near-memory HBC и ускорители AI250 и AI30025 июня 2026 г.
- TrustMem: фреймворк для более надёжной консолидации долгосрочной памяти у LLM‑агентов25 июня 2026 г.
- CompressKV предлагает семантический подход к сжатию KV‑кэша для длинного контекста в LLM24 июня 2026 г.
- Сжатие KV‑кэша становится ключевой задачей для LLM: подходы TurboQuant, OSCAR и EpiCache18 июня 2026 г.