Вы используете устаревший браузер. Этот и другие сайты могут отображаться в нем неправильно. Необходимо обновить браузер или попробовать использовать другой.
Что делает токенизатор и почему это важно
LLM не работает с текстом напрямую. Перед подачей в модель строка разбивается на токены — целочисленные идентификаторы, каждый из которых соответствует фрагменту текста: символу, части слова или целому слову. От того, как именно происходит это...
Когда LLM возвращает текст, который нужно разобрать программно, возникает проблема: модель не гарантирует, что ответ будет валидным JSON. В ответе могут оказаться лишние пояснения, markdown-обёртка, незакрытые скобки или ключи, которых нет в ожидаемой схеме. Регулярные выражения и ручной парсинг...
Бенчмарк показывает, как модель справляется с задачами, которые кто-то другой счёл репрезентативными. Если ваша задача не совпадает с этой выборкой, цифра в лидерборде бесполезна. Оценка качества LLM — это не выбор одного числа из таблицы, а построение системы измерений, которая отвечает на...
Качество дообучения определяется датасетом ещё до начала тренировки. Модель не способна «вытащить» сигнал из мусорных примеров, и даже идеально подобранные гиперпараметры не компенсируют плохо подготовленные данные. Подготовка датасета — это не разовый шаг, а итеративный процесс: сбор, очистка...
Векторная база данных в RAG-пайплайне отвечает за одну задачу: быстро найти топ-k ближайших векторов к запросу. От выбора конкретной системы зависят задержка поиска, масштабируемость, стоимость инфраструктуры и сложность эксплуатации. Ниже — разбор основных вариантов с акцентом на то, что...
Почему размер чанка определяет качество retrieval
RAG-система ищет не по исходному документу, а по его фрагментам — чанкам. Каждый чанк превращается в вектор через embedding-модель Как выбрать embedding-модель для RAG: размер вектора, язык, качество и стоимость поиска, и именно этот вектор...
Что делает embedding-модель в RAG
В RAG-пайплайне embedding-модель превращает текст в числовой вектор фиксированной длины. Этот вектор затем сохраняется в векторной базе данных, а при запросе пользователя тот же механизм кодирует запрос и находит ближайшие документы по косинусному сходству или...
Что делает квантизация
Квантизация снижает требования к памяти при загрузке и инференсе модели за счёт хранения весов в формате с меньшей точностью. Исходно веса хранятся в full-precision (fp32), но уже half-precision (fp16 или bf16) стал стандартом для большинства современных LLM. Квантизация...
Токен как единица контекста
Языковая модель не работает с текстом как с последовательностью символов. Перед подачей в модель текст разбивается на токены — минимальные единицы, которые модель воспринимает и генерирует. Токенизация выполняется препроцессором, который входит в определение модели...
Введение
В мире искусственного интеллекта и дообучения больших языковых моделей (LLM) возникло множество методов, позволяющих адаптировать модели под конкретные задачи без необходимости дообучения всех параметров. Два таких подхода — LoRA и QLoRA — стали популярными благодаря своей...
Введение
Локальный запуск языковых моделей (LLM) требует тщательного планирования ресурсов, особенно объема видеопамяти (VRAM). Современные модели, такие как Llama-3.3-70B или Qwen-VL-72B, могут потреблять несколько гигабайт VRAM, что делает важным понимание того, как именно память используется...
Что такое RAG?
RAG (Retrieval-Augmented Generation) — это архитектура, которая сочетает возможности поиска информации и генерации текста. Она позволяет языковым моделям (LLM) использовать внешние данные для формирования ответов, что значительно повышает точность и релевантность. В отличие от...
Современные нейросети умеют писать тексты, создавать программный код, анализировать документы, распознавать изображения и поддерживать диалог.
Иногда их ответы настолько убедительны, что может показаться, будто внутри компьютера действительно появился разум.
Однако между способностью...
Современная нейросеть редко работает изолированно.
Обычно вокруг модели строится целая система:
Пользователь
↓
Веб-интерфейс или API
↓
Системный prompt
↓
Языковая модель
↓
RAG и база документов
↓
Инструменты и плагины
↓
Файлы, почта, браузер, серверы и базы данных...
В описании языковых моделей часто встречаются обозначения:
7B
14B
32B
70B
Например:
Qwen 7B
Qwen 32B
Llama 70B
Буква B означает billion — миллиард.
Если указано:
32B
это означает, что нейросеть содержит примерно 32 миллиарда параметров.
Основную часть этих параметров составляют веса...