Когда задача передается от небольшой модели к более крупной или обратно, возникают накладные расходы. Принимающей модели приходится заново обрабатывать весь диалог, из-за чего растут вычислительные затраты и задержка. Как сообщает VentureBeat, исследователи Nvidia представили технику межмодельного переноса KV-кэша для длительных агентных процессов с несколькими LLM.
Метод напрямую преобразует предварительно заполненный KV-кэш исходной модели в кэш целевой. Дорогостоящая модель глубокого обучения для этого не нужна. Решение рассчитано на приложения, где контекст накапливается в течение многих итераций.
В экспериментах с совместимыми парами моделей линейное преобразование выполнялось в 2,7–25 раз быстрее, чем повторное вычисление диалога. При этом сохранялось до 98% точности, которую целевая модель показывала при самостоятельной работе.
Ключевые факты
На совместимых парах моделей преобразование выполнялось в 2,7–25 раз быстрее повторного вычисления диалога.
Метод сохранял до 98% точности целевой модели при ее самостоятельной работе.
Без переноса кэша принимающая модель заново обрабатывает весь накопленный диалог.
Вопросы и ответы
- Для каких сценариев предназначен метод?
Для длительных агентных процессов с несколькими LLM, где задача передается между небольшой и крупной моделями, а контекст накапливается в течение многих итераций.
- Как перенос кэша влияет на скорость и качество?
На совместимых парах моделей линейное преобразование было в 2,7–25 раз быстрее повторной обработки диалога и сохраняло до 98% точности целевой модели.
- Что меняется в вычислениях на практике?
Принимающая модель получает преобразованный предварительно заполненный KV-кэш вместо повторной обработки всего накопленного диалога, причем отдельная дорогостоящая модель глубокого обучения для этого не нужна.