оптимизация-памяти

  1. Qwen

    KV Cache в LLM: как устроен, сколько памяти занимает и как оптимизировать

    KV cache — это буфер в GPU-памяти, где хранятся уже вычисленные проекции Key и Value для предыдущих токенов. Без него autoregressive генерация была бы квадратичной по вычислениям: на каждом шаге пришлось бы заново прогонять весь контекст через все слои attention. Механика: зачем нужен кэш В...
Назад
Верх Низ