У длинных AI-агентов появился практический путь за пределы HBM: хранить часть KV-кеша в CPU DRAM, причем переносить туда не тяжелый bf16, а 4-битное представление. В тестах AMD такая связка повысила плотность обслуживания и снизила задержку, поэтому покупать ускоритель ради дополнительной HBM теперь стоит только после сравнения с более дешевой архитектурой памяти на своей нагрузке.
Что сделала AMD
В блоге AMD описана реализация для AMD Instinct MI355X, которая объединяет TurboQuant, LMCache и vLLM. TurboQuant сжимает KV-кеш до 4 бит, а LMCache распределяет его между быстрой GPU HBM и более вместительной, но медленной CPU DRAM. Если нужного фрагмента нет в HBM, система загружает его из DRAM вместо повторного расчета всего префикса.
Это важно именно для агентов. По данным AMD, при переходе между ходами они повторно используют около 95% контекста: системный промпт, инструменты, найденные файлы и текущий план. При десятках и сотнях тысяч токенов HBM начинает заполнять уже не модель, а KV-кеш. После этого приходится либо заново считать удаленный префикс и снова платить задержкой первого токена, либо возвращать кеш с более медленного уровня памяти.
Разработчики не сжимают все слои одинаково. Первые два и последние два attention-слоя остаются в bf16 как наиболее чувствительные к точности, а 58 средних слоев упаковываются в 4 бита. Коннектор LMCache различает эти форматы и переносит их отдельными группами. AMD называет возврат данных побитово точным, а подход нейтральным по качеству.
На фиксированном бюджете HBM и DRAM 4-битный кеш позволил удерживать в HBM примерно в 3,2 раза больше KV. Доля попаданий в LMCache выросла с 75,2% для bf16 до 86,8% с TurboQuant. В 20-минутном воспроизведении нагрузки система завершила примерно вдвое больше запросов, показала в 2,6 раза меньший p95 времени до первого токена и передала между уровнями памяти в 1,7 раза меньше данных.
HBM перестает быть единственным ответом
До сих пор квантование KV-кеша и многоуровневое хранение развивались в основном отдельно. Одни методы пытались сделать каждый токен меньше, другие решали, что оставить в HBM, а что выгрузить. Исследования CompressKV, FreqDepthKV и Predictive Multi-Tier Memory Management показывают тот же общий диагноз: длинный контекст упирается не только в вычисления, но и в объем кеша и пропускную способность памяти.
Связка AMD и LMCache интереснее очередного рекорда сжатия именно потому, что соединяет оба приема в обслуживающую систему. Квантование дольше удерживает горячие данные в HBM, а выгрузка в DRAM не дает холодному контексту исчезнуть совсем. Экономия складывается дважды: реже нужен перенос, а при переносе едет меньше байтов.
Для бизнеса вывод не в том, что HBM больше не нужна. Она остается самым быстрым уровнем. Меняется другое: объем HBM перестает быть единственным способом увеличить число длинных одновременных сессий. Если агент постоянно возвращается к одним и тем же документам и истории диалога, часть бюджета потенциально выгоднее направить на CPU DRAM и программный слой кеширования, а не на ускоритель, выбранный прежде всего ради памяти.
Но цифры AMD пока следует читать как основание для собственного теста, а не как универсальный коэффициент экономии. Заявленная нейтральность по качеству зависит от того, насколько удачно выбран компромисс между bf16 и 4 битами. Задержка зависит от частоты промахов, размера повторно используемых префиксов и того, сколько данных одновременно ходит между HBM и DRAM. Двукратный goodput в опубликованном replay не обещает двукратного результата в вашем продакшене.
Что измерить до покупки GPU
Главный маркер здесь не степень сжатия сама по себе. Смотрите сразу на четыре показателя: долю попаданий в HBM, p95 времени до первого токена, число завершенных запросов при фиксированной длительности теста и качество ответов на ваших длинных сценариях.
Если 4-битный LMCache повышает hit rate и плотность сессий без неприемлемой просадки качества и p95, дополнительная HBM превращается из обязательного требования в дорогую опцию. Если же DRAM-переносы начинают доминировать в задержке или квантование портит многошаговые задачи, экономия останется красивой строкой в инфраструктурной презентации. Проверять это уже можно на MI355X, и следующий бюджет агентного инференса разумно начинать именно с такого replay.