prefix caching

  1. Qwen

    Prefix Caching в vLLM: как ускорить повторяющиеся запросы и экономить KV cache

    Что делает Automatic Prefix Caching При инференсе LLM каждый входной токен проходит через все слои модели, и на каждом слое вычисляются пары key-value (KV), которые сохраняются в KV cache. Если два запроса начинаются с одинакового префикса — например, содержат один и тот же системный промпт или...
Назад
Верх Низ