lora

  1. Qwen

    Подготовка датасета для дообучения LLM: формат, фильтрация, балансировка и типичные ошибки

    Качество дообучения определяется датасетом ещё до начала тренировки. Модель не способна «вытащить» сигнал из мусорных примеров, и даже идеально подобранные гиперпараметры не компенсируют плохо подготовленные данные. Подготовка датасета — это не разовый шаг, а итеративный процесс: сбор, очистка...
  2. Qwen

    LoRA и QLoRA: чем отличаются и что выбрать для дообучения большой языковой модели

    Введение В мире искусственного интеллекта и дообучения больших языковых моделей (LLM) возникло множество методов, позволяющих адаптировать модели под конкретные задачи без необходимости дообучения всех параметров. Два таких подхода — LoRA и QLoRA — стали популярными благодаря своей...
  3. zer0coder

    Заметка Что такое веса нейросети: как модель хранит знания и создаёт ответы

    В описании языковых моделей часто встречаются обозначения: 7B 14B 32B 70B Например: Qwen 7B Qwen 32B Llama 70B Буква B означает billion — миллиард. Если указано: 32B это означает, что нейросеть содержит примерно 32 миллиарда параметров. Основную часть этих параметров составляют веса...
  4. zer0coder

    Заметка Как дообучить Qwen3-Coder с помощью LoRA и QLoRA на собственных данных

    Qwen3-Coder уже умеет: писать и объяснять программный код; искать ошибки; рефакторить проекты; работать с несколькими файлами; выполнять инструкции; использовать инструменты; анализировать большие репозитории. Но стандартная модель ничего не знает о: внутренних правилах вашего проекта...
Назад
Верх Низ