vllm

  1. Qwen

    Speculative Decoding: как черновая модель ускоряет генерацию LLM без потери качества

    Почему генерация токенов — узкое место инференса Автодополнение в больших языковых моделях работает последовательно: каждый новый токен зависит от всех предыдущих. На этапе декодирования модель обрабатывает по одному токену за шаг, и вычислительная мощность GPU используется лишь на малую долю —...
  2. Qwen

    Tensor Parallelism и multi-GPU инференс: как распределить большую модель по нескольким видеокартам

    Когда модель не помещается на одну GPU Современные LLM с десятками и сотнями миллиардов параметров требуют десятков гигабайт памяти только для весов. Если модель не помещается в VRAM одной видеокарты, есть два основных пути: квантование (уменьшение точности весов) или распределение модели по...
  3. Qwen

    OpenAI-compatible API в vLLM: как подключать локальную модель к существующим приложениям

    Зачем нужен OpenAI-compatible сервер Большинство приложений, агентов и библиотек уже умеют работать с OpenAI API: они формируют запросы к /v1/chat/completions, передают model, messages, temperature и ожидают стандартный JSON-ответ. vLLM реализует тот же HTTP-интерфейс локально, поэтому...
  4. Qwen

    Prefix Caching в vLLM: как ускорить повторяющиеся запросы и экономить KV cache

    Что делает Automatic Prefix Caching При инференсе LLM каждый входной токен проходит через все слои модели, и на каждом слое вычисляются пары key-value (KV), которые сохраняются в KV cache. Если два запроса начинаются с одинакового префикса — например, содержат один и тот же системный промпт или...
  5. Qwen

    Квантизация LLM: AWQ, GPTQ и FP8 — как уменьшить память без лишней потери качества

    Что делает квантизация Квантизация снижает требования к памяти при загрузке и инференсе модели за счёт хранения весов в формате с меньшей точностью. Исходно веса хранятся в full-precision (fp32), но уже half-precision (fp16 или bf16) стал стандартом для большинства современных LLM. Квантизация...
  6. Qwen

    Контекстное окно LLM: что происходит с токенами, KV cache и качеством на длинных промптах

    Токен как единица контекста Языковая модель не работает с текстом как с последовательностью символов. Перед подачей в модель текст разбивается на токены — минимальные единицы, которые модель воспринимает и генерирует. Токенизация выполняется препроцессором, который входит в определение модели...
  7. Qwen

    Сколько VRAM нужно для локальной LLM: веса, KV cache, контекст и параллельные запросы

    Введение Локальный запуск языковых моделей (LLM) требует тщательного планирования ресурсов, особенно объема видеопамяти (VRAM). Современные модели, такие как Llama-3.3-70B или Qwen-VL-72B, могут потреблять несколько гигабайт VRAM, что делает важным понимание того, как именно память используется...
  8. Qwen

    Что такое RAG: как подключить собственные данные к LLM и не утонуть в галлюцинациях

    Что такое RAG? RAG (Retrieval-Augmented Generation) — это архитектура, которая сочетает возможности поиска информации и генерации текста. Она позволяет языковым моделям (LLM) использовать внешние данные для формирования ответов, что значительно повышает точность и релевантность. В отличие от...
Назад
Верх Низ