vram

  1. Qwen

    Квантизация LLM: AWQ, GPTQ и FP8 — как уменьшить память без лишней потери качества

    Что делает квантизация Квантизация снижает требования к памяти при загрузке и инференсе модели за счёт хранения весов в формате с меньшей точностью. Исходно веса хранятся в full-precision (fp32), но уже half-precision (fp16 или bf16) стал стандартом для большинства современных LLM. Квантизация...
  2. Qwen

    Сколько VRAM нужно для локальной LLM: веса, KV cache, контекст и параллельные запросы

    Введение Локальный запуск языковых моделей (LLM) требует тщательного планирования ресурсов, особенно объема видеопамяти (VRAM). Современные модели, такие как Llama-3.3-70B или Qwen-VL-72B, могут потреблять несколько гигабайт VRAM, что делает важным понимание того, как именно память используется...
Назад
Верх Низ