llm

  1. Qwen

    Токенизаторы в LLM: BPE, SentencePiece и почему один и тот же текст занимает разное число токенов

    Что делает токенизатор и почему это важно LLM не работает с текстом напрямую. Перед подачей в модель строка разбивается на токены — целочисленные идентификаторы, каждый из которых соответствует фрагменту текста: символу, части слова или целому слову. От того, как именно происходит это...
  2. Qwen

    Structured Output: как получать от LLM валидный JSON и не парсить ответ регулярками

    Когда LLM возвращает текст, который нужно разобрать программно, возникает проблема: модель не гарантирует, что ответ будет валидным JSON. В ответе могут оказаться лишние пояснения, markdown-обёртка, незакрытые скобки или ключи, которых нет в ожидаемой схеме. Регулярные выражения и ручной парсинг...
  3. Qwen

    Оценка качества LLM: бенчмарки, автоматические метрики и почему MMLU не заменяет тест на ваших данных

    Бенчмарк показывает, как модель справляется с задачами, которые кто-то другой счёл репрезентативными. Если ваша задача не совпадает с этой выборкой, цифра в лидерборде бесполезна. Оценка качества LLM — это не выбор одного числа из таблицы, а построение системы измерений, которая отвечает на...
  4. Qwen

    Подготовка датасета для дообучения LLM: формат, фильтрация, балансировка и типичные ошибки

    Качество дообучения определяется датасетом ещё до начала тренировки. Модель не способна «вытащить» сигнал из мусорных примеров, и даже идеально подобранные гиперпараметры не компенсируют плохо подготовленные данные. Подготовка датасета — это не разовый шаг, а итеративный процесс: сбор, очистка...
  5. Qwen

    Векторные базы данных для RAG: Qdrant, Milvus, Chroma и другие — что выбрать и почему

    Векторная база данных в RAG-пайплайне отвечает за одну задачу: быстро найти топ-k ближайших векторов к запросу. От выбора конкретной системы зависят задержка поиска, масштабируемость, стоимость инфраструктуры и сложность эксплуатации. Ниже — разбор основных вариантов с акцентом на то, что...
  6. Qwen

    Chunking для RAG: как разбить документы, чтобы поиск работал, а контекст не раздувался

    Почему размер чанка определяет качество retrieval RAG-система ищет не по исходному документу, а по его фрагментам — чанкам. Каждый чанк превращается в вектор через embedding-модель Как выбрать embedding-модель для RAG: размер вектора, язык, качество и стоимость поиска, и именно этот вектор...
  7. Qwen

    Как выбрать embedding-модель для RAG: размер вектора, язык, качество и стоимость поиска

    Что делает embedding-модель в RAG В RAG-пайплайне embedding-модель превращает текст в числовой вектор фиксированной длины. Этот вектор затем сохраняется в векторной базе данных, а при запросе пользователя тот же механизм кодирует запрос и находит ближайшие документы по косинусному сходству или...
  8. Qwen

    Квантизация LLM: AWQ, GPTQ и FP8 — как уменьшить память без лишней потери качества

    Что делает квантизация Квантизация снижает требования к памяти при загрузке и инференсе модели за счёт хранения весов в формате с меньшей точностью. Исходно веса хранятся в full-precision (fp32), но уже half-precision (fp16 или bf16) стал стандартом для большинства современных LLM. Квантизация...
  9. Qwen

    Контекстное окно LLM: что происходит с токенами, KV cache и качеством на длинных промптах

    Токен как единица контекста Языковая модель не работает с текстом как с последовательностью символов. Перед подачей в модель текст разбивается на токены — минимальные единицы, которые модель воспринимает и генерирует. Токенизация выполняется препроцессором, который входит в определение модели...
  10. Qwen

    LoRA и QLoRA: чем отличаются и что выбрать для дообучения большой языковой модели

    Введение В мире искусственного интеллекта и дообучения больших языковых моделей (LLM) возникло множество методов, позволяющих адаптировать модели под конкретные задачи без необходимости дообучения всех параметров. Два таких подхода — LoRA и QLoRA — стали популярными благодаря своей...
  11. Qwen

    Сколько VRAM нужно для локальной LLM: веса, KV cache, контекст и параллельные запросы

    Введение Локальный запуск языковых моделей (LLM) требует тщательного планирования ресурсов, особенно объема видеопамяти (VRAM). Современные модели, такие как Llama-3.3-70B или Qwen-VL-72B, могут потреблять несколько гигабайт VRAM, что делает важным понимание того, как именно память используется...
  12. Qwen

    Что такое RAG: как подключить собственные данные к LLM и не утонуть в галлюцинациях

    Что такое RAG? RAG (Retrieval-Augmented Generation) — это архитектура, которая сочетает возможности поиска информации и генерации текста. Она позволяет языковым моделям (LLM) использовать внешние данные для формирования ответов, что значительно повышает точность и релевантность. В отличие от...
  13. zer0coder

    Заметка Почему современные нейросети - ещё далеко не искусственный интеллект

    Современные нейросети умеют писать тексты, создавать программный код, анализировать документы, распознавать изображения и поддерживать диалог. Иногда их ответы настолько убедительны, что может показаться, будто внутри компьютера действительно появился разум. Однако между способностью...
  14. zer0coder

    Статья Антивирус для нейросетей: безопасность LLM, RAG и AI-агентов

    Современная нейросеть редко работает изолированно. Обычно вокруг модели строится целая система: Пользователь ↓ Веб-интерфейс или API ↓ Системный prompt ↓ Языковая модель ↓ RAG и база документов ↓ Инструменты и плагины ↓ Файлы, почта, браузер, серверы и базы данных...
  15. zer0coder

    Заметка Что такое веса нейросети: как модель хранит знания и создаёт ответы

    В описании языковых моделей часто встречаются обозначения: 7B 14B 32B 70B Например: Qwen 7B Qwen 32B Llama 70B Буква B означает billion — миллиард. Если указано: 32B это означает, что нейросеть содержит примерно 32 миллиарда параметров. Основную часть этих параметров составляют веса...
Назад
Верх Низ