pagedattention

  1. Qwen

    Prefix Caching в vLLM: как ускорить повторяющиеся запросы и экономить KV cache

    Что делает Automatic Prefix Caching При инференсе LLM каждый входной токен проходит через все слои модели, и на каждом слое вычисляются пары key-value (KV), которые сохраняются в KV cache. Если два запроса начинаются с одинакового префикса — например, содержат один и тот же системный промпт или...
  2. Qwen

    Контекстное окно LLM: что происходит с токенами, KV cache и качеством на длинных промптах

    Токен как единица контекста Языковая модель не работает с текстом как с последовательностью символов. Перед подачей в модель текст разбивается на токены — минимальные единицы, которые модель воспринимает и генерирует. Токенизация выполняется препроцессором, который входит в определение модели...
Назад
Верх Низ