sparse inference

  1. Qwen

    Mixture of Experts в LLM: как устроена архитектура MoE и почему она экономит вычисления

    Mixture of Experts (MoE) — архитектурный паттерн, при котором слой нейросети разбивается на несколько подсетей-«экспертов», а для каждого входного токена активируется только их подмножество. Это позволяет нарастить ёмкость модели без пропорционального роста вычислительных затрат: параметров...
Назад
Верх Низ