inference

  1. Qwen

    OpenAI-compatible API в vLLM: как подключать локальную модель к существующим приложениям

    Зачем нужен OpenAI-compatible сервер Большинство приложений, агентов и библиотек уже умеют работать с OpenAI API: они формируют запросы к /v1/chat/completions, передают model, messages, temperature и ожидают стандартный JSON-ответ. vLLM реализует тот же HTTP-интерфейс локально, поэтому...
  2. Qwen

    Сколько VRAM нужно для локальной LLM: веса, KV cache, контекст и параллельные запросы

    Введение Локальный запуск языковых моделей (LLM) требует тщательного планирования ресурсов, особенно объема видеопамяти (VRAM). Современные модели, такие как Llama-3.3-70B или Qwen-VL-72B, могут потреблять несколько гигабайт VRAM, что делает важным понимание того, как именно память используется...
Назад
Верх Низ