Назад в ленту

Nvidia ускорила переключение LLM-моделей в 25 раз с помощью линейной математики

Исследователи Nvidia нашли способ передавать KV-кэш между моделями одного семейства, избавившись от дорогостоящего повторного пересчёта диалога при смене модели.

Nvidia нашла способ разогнать переключение Llm моделей в 25 раз — всё дело в математике и Kv Cache

Каждый раз, когда ИИ-агент передает задачу от маленькой модели к большой (или наоборот), систему ждет суровый налог: принимающая модель вынуждена пересчитывать весь диалог с нуля. Это настоящий тормоз для любого production-сценария, пожирающий и время, и вычислительные ресурсы. Но исследователи из Nvidia решили эту проблему не через тяжелые нейросети, а через простую линейную математику.

Суть их подхода — крос-модельная передача KV-кэша (cross-model KV cache transfer). Вместо того чтобы заставлять приемник пересчитывать все с нуля (этап префилла), они напрямую отображают уже готовый кэш из одной LLM модели в другую. Для enterprise-инфраструктур, где контексты разрастаются до сотен тысяч токенов, это не просто оптимизация, а спасение бюджета. Эксперименты показали: на совместимых парах моделей процесс работает в 2,7–25 раз быстрее, чем полный пересчет, сохраняя до 98% точности целевой модели.

Почему смена модели на лету так дорого обходится

Чтобы понять корень проблемы, заглянем под капот. Когда LLM получает промпт, она сначала проходит стадию «префилл» — начальный прямой проход, вычисляющий ключи и значения для всех входных токенов и заполняющий KV-кэш. Затем начинается фаза «декодирования», где модель уже генерирует новые токены, опираясь на этот кэш.

В длинных мульти-турных диалогах или сессиях ИИ-агентов контекст постоянно растет. А стоимость префилла масштабируется линейно и от размера модели, и от длины входного текста. Любая смена модели в середине сессии аннулирует кэш — и приемник платит полную цену повторного префилла. Это происходит постоянно, когда простая LLM модель обрабатывает рутинные запросы, а сложные передает наверх большой.

Перенос памяти между моделями без перезапуска

Исследователи из Nvidia пошли дальше простого отказа от пересчета. Они изучили, как преобразовать KV-кэш одной модели в формат другой без запуска префилла заново. Идея работает в обе стороны: маленькие Llm модели передают задачу большим для повышения качества ответов, а крупные могут «сбросить» кэш вниз — на легковесную модель, чтобы сэкономить на ресурсах, когда сессия уходит в бытовые вопросы.

Прошлые попытки решить эту задачу упирались в дорогой градиентный тюнинг или жесткие архитектурные ограничения. Команда из Nvidia подошла иначе: они доказали, что крос-модельный KV-кэш имеет существенную линейную структуру. То есть для отображения достаточно простых алгебраических трюков, а не обучения тяжелых нейронок.

На практике это выглядит так: при переносе кэша с Qwen3 на 14 млрд параметров на версию с 32 млрд, простая линейная регрессия с одного слоя-источника вытягивала 56% дисперсии ключей и 32% значений в целевой модели. Комбинируя несколько исходных слоев, показатели поднимались до 79% и 65% соответственно.

Для практической реализации исследователи собрали замкнутый пер-хед ридж-маппер (по-русски — гребневый регрессор на каждую голову внимания). Он работает так:

Пер-хед гребневая регрессия. Никакого тяжелого глубокого обучения — подгоняется простая линейная регрессия на крошечном калибровочном наборе из пары сотен текстовых последовательностей. Классическая задача поиска линии наилучшего соответствия, решаемая отдельно для каждой головы внимания.

Выбор релевантных исходных слоев. Поскольку у исходной и целевой модели разное количество слоев, маппер оценивает, какие слои-источники наиболее предсказуемы для каждого конкретного целевого слоя. Система берет только самую полезную память.

Отображение в пространстве контента. Перед трансляцией маппер отрезает RoPE-энкодинг (циклические позиционные внедрения), которые нужны модели для понимания порядка токнов. Удаление RoPE позволяет обобщать на последовательности любой длины, выходящей за пределы калибровочных данных.

Линейный маппер на практике: тесты и цифры

Для проверки работоспособности исследователи прогнали метод через шесть семейств «matched-KV» моделей — где у источника и приемника совпадают количество KV-голов и размерность на каждую голову. В тест попали Qwen3, Llama 3.1 и Ministral 3 с размерами от 3 до 70 миллиардов параметров. В том числе скачок в 8,8 раза: с Llama 3.1 8B до 70B.

Замеры проводили на пяти бенчмарках точности (ARC-Challenge, HellaSwag, WinoGrande, MMLU, GSM8K), а также на перплексии по WikiText-2 и задаче мульти-турных диалогов CoQA. Для калибровки хватило всего 500 последовательностей по 1024 токена каждая.

В четырех из шести пар простая гребневая регрессия удержала от 73% до 98% стандартной точности префилла. Время работы маппера — от 2,7 до 25 раз быстрее полного пересчета. Конкретный пример: перенос кэша длиной 32 768 токенов с Qwen3 14B на 32B занял 278 миллисекунд. Стандартный повторный префилл на тех же данных — почти 7 секунд.

Система оказалась стабильной и на длинных диалогах: дрейф точности между базовой моделью и перенесенным кэшем оставался минимальным даже через 10 шагов разговора. Это значит, что ошибка не накапливается и не приводит к коллапсу длинных сессий.

Но без нюансов не обошлось. На двух конфигурациях Ministral линейный маппер резко деградировал — простая регрессия не смогла экстраполировать за пределы калибровочных данных. Исследователи заменили ее на нелинейный многослойный перцептрон (MLP) с двумя скрытыми слоями по 1024 нейрона. Это добавило сложности и затрат на обучение, зато точность вернулась выше 90%.

Проблема шире одной статьи

Сам подход с крос-модельной передачей KV-кэша — лишь часть глобального тренда. Управление этим слоем памяти становится ключевым навыком для масштабирования enterprise-сценариев с LLM. Nvidia уже представила динамическую разреженность памяти (DMS), которая вырезает неважные токены из кэша, снижая затраты на рассуждения до 8 раз. Есть и агрессивное сжатие: MIT разработали технику Attention Matching, сжимающую KV-кэш в 50 раз без потери качества. Сама же Nvidia придумала KVTC, позаимствовав концепции у сжатия медиаконтента и сократив память на 20x.

Параллельно оптимизируют и извлечение данных: IndexCache убирает избыточные вычисления между слоями, ускоряя время до первого токена. Архитектурные эксперименты DeepSeek и серии GLM также заточены под эффективное управление KV-кэшом. Исследователи из Nvidia подчеркивают: их метод пока ограничен «внутрисемейными» переносами (Qwen в Qwen, Llama в Llama), но он открывает дорогу для крос-семейных передач, несовпадающих KV-голов и гибридных архитектур.

Технология только начинает путь в продакшн, но выглядит чертовски многообещающе. Особенно для тех, кто строит многомодельные агентные системы и хочет, чтобы они не разоряли бюджет на префилл.

Справка по теме (FAQ)
Что такое KV-кэш и зачем он нужен в LLM?
KV-кэш (Key-Value cache) — это слой памяти, где модель хранит вычисленные ключи и значения для всех входных токенов. Он заполняется на этапе префилла и используется при генерации новых токенов. Чем длиннее контекст, тем больше памяти требуется для кэша.
Почему смена модели в диалоге обходится так дорого?
Каждый раз при переключении принимающая модель должна пересчитать весь диалог с нуля, то есть снова пройти этап префилла. Стоимость этого процесса растёт линейно вместе с длиной входного текста, поэтому в длинных сессиях это становится настоящим пожирателем ресурсов.
Как работает метод Nvidia для крос-модельной передачи KV-кэша?
Исследователи из Nvidia доказали, что крос-модельный KV-кэш имеет существенную линейную структуру. Вместо обучения тяжёлых нейросетей они используют пер-хед гребневую регрессию — простую линейную модель, которая подгоняется на калибровочном наборе из пары сотен последовательностей и отображает кэш одной модели в формат другой. Система также отрезает RoPE-энкодинг, чтобы обобщать на последовательности любой длины.
Какие модели тестировались и каковы результаты?
Метод прогнали через шесть семейств «matched-KV» моделей, включая Qwen3, Llama 3.1 и Ministral 3 с размерами от 3 до 70 миллиардов параметров. В четырёх из шести пар точность сохранилась на 73–98%, а скорость работы выросла в 2,7–25 раз. На двух конфигурациях Ministral пришлось заменить линейную регрессию на нелинейный MLP, чтобы вернуть точность выше 90%.