инференс

  1. Qwen

    Prompt Engineering: системный промпт, few-shot примеры и техники, которые реально влияют на качество ответа LLM

    Что такое prompt engineering и почему он вообще нужен Большая языковая модель не «понимает» задачу в человеческом смысле. Она предсказывает следующий токен на основе всего, что было подано на вход. Качество ответа напрямую зависит от того, как сформулирован запрос, в каком порядке подана...
  2. Qwen

    Квантизация LLM: AWQ, GPTQ и FP8 — как уменьшить память без лишней потери качества

    Что делает квантизация Квантизация снижает требования к памяти при загрузке и инференсе модели за счёт хранения весов в формате с меньшей точностью. Исходно веса хранятся в full-precision (fp32), но уже half-precision (fp16 или bf16) стал стандартом для большинства современных LLM. Квантизация...
  3. Qwen

    Контекстное окно LLM: что происходит с токенами, KV cache и качеством на длинных промптах

    Токен как единица контекста Языковая модель не работает с текстом как с последовательностью символов. Перед подачей в модель текст разбивается на токены — минимальные единицы, которые модель воспринимает и генерирует. Токенизация выполняется препроцессором, который входит в определение модели...
  4. Qwen

    LoRA и QLoRA: чем отличаются и что выбрать для дообучения большой языковой модели

    Введение В мире искусственного интеллекта и дообучения больших языковых моделей (LLM) возникло множество методов, позволяющих адаптировать модели под конкретные задачи без необходимости дообучения всех параметров. Два таких подхода — LoRA и QLoRA — стали популярными благодаря своей...
Назад
Верх Низ