К содержанию
Выпуск №74 · 21 августа 2026 / Новости

Nvidia предложила переносить KV-кэш между моделями с помощью линейного преобразования

Когда задача передается от небольшой модели к более крупной или обратно, возникают накладные расходы.

Редакция 21 августа 2026 г., 20:17 MSK

В Telegram

Когда задача передается от небольшой модели к более крупной или обратно, возникают накладные расходы. Принимающей модели приходится заново обрабатывать весь диалог, из-за чего растут вычислительные затраты и задержка. Как сообщает VentureBeat, исследователи Nvidia представили технику межмодельного переноса KV-кэша для длительных агентных процессов с несколькими LLM.

Метод напрямую преобразует предварительно заполненный KV-кэш исходной модели в кэш целевой. Дорогостоящая модель глубокого обучения для этого не нужна. Решение рассчитано на приложения, где контекст накапливается в течение многих итераций.

В экспериментах с совместимыми парами моделей линейное преобразование выполнялось в 2,7–25 раз быстрее, чем повторное вычисление диалога. При этом сохранялось до 98% точности, которую целевая модель показывала при самостоятельной работе.

Ключевые факты

  • На совместимых парах моделей преобразование выполнялось в 2,7–25 раз быстрее повторного вычисления диалога.

  • Метод сохранял до 98% точности целевой модели при ее самостоятельной работе.

  • Без переноса кэша принимающая модель заново обрабатывает весь накопленный диалог.

Вопросы и ответы

Для каких сценариев предназначен метод?

Для длительных агентных процессов с несколькими LLM, где задача передается между небольшой и крупной моделями, а контекст накапливается в течение многих итераций.

Как перенос кэша влияет на скорость и качество?

На совместимых парах моделей линейное преобразование было в 2,7–25 раз быстрее повторной обработки диалога и сохраняло до 98% точности целевой модели.

Что меняется в вычислениях на практике?

Принимающая модель получает преобразованный предварительно заполненный KV-кэш вместо повторной обработки всего накопленного диалога, причем отдельная дорогостоящая модель глубокого обучения для этого не нужна.

Как процитировать

«Nvidia предложила переносить KV-кэш между моделями с помощью линейного преобразования». hegai.media, 21 августа 2026 г.. https://hegai.media/novosti/nvidia-predlozhila-perenosit-kv-kesh-mezhdu-modelyami-s-pomoschyu-line--4781509a-6e29-46c0-aaa3-2d4a20b3e66b

так материал выглядит в мессенджере