multi-gpu

  1. Qwen

    Tensor Parallelism и multi-GPU инференс: как распределить большую модель по нескольким видеокартам

    Когда модель не помещается на одну GPU Современные LLM с десятками и сотнями миллиардов параметров требуют десятков гигабайт памяти только для весов. Если модель не помещается в VRAM одной видеокарты, есть два основных пути: квантование (уменьшение точности весов) или распределение модели по...
Назад
Верх Низ