К содержанию
Выпуск №82 · 29 августа 2026 / Новости

4-битный KV-кеш может заменить лишнюю HBM, если выдержит вашу нагрузку

AMD и LMCache вынесли квантованный кеш агентного контекста в CPU DRAM и получили больше запросов при меньшей задержке. Для инфраструктурных команд это повод пересчитать экономику инференса, но не принимать результаты одного теста за готовый прайс-лист.

Редакция 29 августа 2026 г., 11:18 MSK

В Telegram

У длинных AI-агентов появился практический путь за пределы HBM: хранить часть KV-кеша в CPU DRAM, причем переносить туда не тяжелый bf16, а 4-битное представление. В тестах AMD такая связка повысила плотность обслуживания и снизила задержку, поэтому покупать ускоритель ради дополнительной HBM теперь стоит только после сравнения с более дешевой архитектурой памяти на своей нагрузке.

Что сделала AMD

В блоге AMD описана реализация для AMD Instinct MI355X, которая объединяет TurboQuant, LMCache и vLLM. TurboQuant сжимает KV-кеш до 4 бит, а LMCache распределяет его между быстрой GPU HBM и более вместительной, но медленной CPU DRAM. Если нужного фрагмента нет в HBM, система загружает его из DRAM вместо повторного расчета всего префикса.

Это важно именно для агентов. По данным AMD, при переходе между ходами они повторно используют около 95% контекста: системный промпт, инструменты, найденные файлы и текущий план. При десятках и сотнях тысяч токенов HBM начинает заполнять уже не модель, а KV-кеш. После этого приходится либо заново считать удаленный префикс и снова платить задержкой первого токена, либо возвращать кеш с более медленного уровня памяти.

Разработчики не сжимают все слои одинаково. Первые два и последние два attention-слоя остаются в bf16 как наиболее чувствительные к точности, а 58 средних слоев упаковываются в 4 бита. Коннектор LMCache различает эти форматы и переносит их отдельными группами. AMD называет возврат данных побитово точным, а подход нейтральным по качеству.

На фиксированном бюджете HBM и DRAM 4-битный кеш позволил удерживать в HBM примерно в 3,2 раза больше KV. Доля попаданий в LMCache выросла с 75,2% для bf16 до 86,8% с TurboQuant. В 20-минутном воспроизведении нагрузки система завершила примерно вдвое больше запросов, показала в 2,6 раза меньший p95 времени до первого токена и передала между уровнями памяти в 1,7 раза меньше данных.

HBM перестает быть единственным ответом

До сих пор квантование KV-кеша и многоуровневое хранение развивались в основном отдельно. Одни методы пытались сделать каждый токен меньше, другие решали, что оставить в HBM, а что выгрузить. Исследования CompressKV, FreqDepthKV и Predictive Multi-Tier Memory Management показывают тот же общий диагноз: длинный контекст упирается не только в вычисления, но и в объем кеша и пропускную способность памяти.

Связка AMD и LMCache интереснее очередного рекорда сжатия именно потому, что соединяет оба приема в обслуживающую систему. Квантование дольше удерживает горячие данные в HBM, а выгрузка в DRAM не дает холодному контексту исчезнуть совсем. Экономия складывается дважды: реже нужен перенос, а при переносе едет меньше байтов.

Для бизнеса вывод не в том, что HBM больше не нужна. Она остается самым быстрым уровнем. Меняется другое: объем HBM перестает быть единственным способом увеличить число длинных одновременных сессий. Если агент постоянно возвращается к одним и тем же документам и истории диалога, часть бюджета потенциально выгоднее направить на CPU DRAM и программный слой кеширования, а не на ускоритель, выбранный прежде всего ради памяти.

Но цифры AMD пока следует читать как основание для собственного теста, а не как универсальный коэффициент экономии. Заявленная нейтральность по качеству зависит от того, насколько удачно выбран компромисс между bf16 и 4 битами. Задержка зависит от частоты промахов, размера повторно используемых префиксов и того, сколько данных одновременно ходит между HBM и DRAM. Двукратный goodput в опубликованном replay не обещает двукратного результата в вашем продакшене.

Что измерить до покупки GPU

Главный маркер здесь не степень сжатия сама по себе. Смотрите сразу на четыре показателя: долю попаданий в HBM, p95 времени до первого токена, число завершенных запросов при фиксированной длительности теста и качество ответов на ваших длинных сценариях.

Если 4-битный LMCache повышает hit rate и плотность сессий без неприемлемой просадки качества и p95, дополнительная HBM превращается из обязательного требования в дорогую опцию. Если же DRAM-переносы начинают доминировать в задержке или квантование портит многошаговые задачи, экономия останется красивой строкой в инфраструктурной презентации. Проверять это уже можно на MI355X, и следующий бюджет агентного инференса разумно начинать именно с такого replay.

Как процитировать

«4-битный KV-кеш может заменить лишнюю HBM, если выдержит вашу нагрузку». hegai.media, 29 августа 2026 г.. https://hegai.media/novosti/4-bitnyy-kv-kesh-mozhet-zamenit-lishnyuyu-hbm-esli-vyderzhit-vashu-nag--a0acddcf-f7bc-4f49-b13c-bd3c0f1f3f59

так материал выглядит в мессенджере