Следуйте инструкциям в видео ниже, чтобы узнать, как установить наш сайт как веб-приложение на главный экран вашего устройства.
Примечание: Эта функция может быть недоступна в некоторых браузерах.

✉️ Email: [email protected]
📲 Telegram канал: https://t.me/zer0kernelorg
💰 Donate (BTC): bc1qwvrgka76eeley8feqdxjxk2866sv0tnweylxjc
bert-base-uncased).bert-base-uncased приводит всё к нижнему регистру и убирает ударения — восстановить исходную строку из токенов невозможно.| Токенизатор | Разбиение | Обработка пробелов | Двойные пробелы |
|---|---|---|---|
| BERT | по пробелам и пунктуации | удаляет | игнорирует |
| GPT-2 | по пробелам и пунктуации | заменяет на Ġ | сохраняет |
| T5 (SentencePiece) | только по пробелам | заменяет на ▁ | игнорирует |
"Hello, how are you?":['Hello', ',', 'how', 'are', 'you', '?'] —...json.loads() не примет.{
"instruction": "Переведи текст на английский язык.",
"input": "Сегодня хорошая погода.",
"output": "The weather is nice today."
}
input опционально: если инструкция самодостаточна, его оставляют пустым. Этот формат используют для SFT (Supervised Fine-Tuning) моделей типа LLaMA, Mistral, Qwen.{
"conversations": [
{"from": "human", "value": "Объясни, что такое TCP handshake."},
{"from": "gpt", "value": "TCP handshake — это трёхэтапный процесс установления соединения..."},
{"from": "human", "value": "А зачем нужен третий пакет?"},
{"from": "gpt", "value": "Третий пакет (ACK) подтверждает..."}
]
}
human/gpt, user/assistant, system/user/assistant — зависит от фреймворка. При конвертации между форматами важно не потерять системный промпт.{"instruction": "...", "input": "", "output": "..."}
{"instruction": "...", "input": "...", "output": "..."}
Текст: [AAAAAAAAAA|BBBBBBBBBB|CCCCCCCCCC]
Чанк 1: [AAAAAAAAAA]
Чанк 2: [AAAA|BBBBBBBBBB]
Чанк 3: [BBBB|CCCCCCCCCC]
| Параметр | Диапазон | Когда использовать |
|---|---|---|
| Размер чанка | 256–1024 токенов | Универсальный старт |
| Overlap | 10–20% от размера | Всегда, кроме поабзацного разбиения |
/v1/chat/completions, передают model, messages, temperature и ожидают стандартный JSON-ответ. vLLM реализует тот же HTTP-интерфейс локально, поэтому переключение с облачного провайдера на собственную модель сводится к замене base_url и api_key — без переписывания бизнес-логики.openai Python-пакет.vllm serve NousResearch/Meta-Llama-3-8B-Instruct \
--dtype auto \
--api-key token-abc123
http://localhost:8000 и будет готов принимать запросы. Флаг --dtype auto позволяет vLLM выбрать оптимальную точность на основе конфигурации модели. --api-key задаёт токен для аутентификации (подробнее об ограничениях ниже).| Флаг | Назначение |
|---|---|
--port 8080 | Сменить порт (по умолчанию 8000) |
--host 0.0.0.0 | Слушать все интерфейсы, а не только localhost |
--tensor-parallel-size 2 | Распределить модель на несколько GPU |
--max-model-len 4096 | Ограничить максимальную длину контекста |
--gpu-memory-utilization 0.9 | Доля GPU-памяти под KV cache |
--chat-template ./tpl.jinja | Указать чат-шаблон вручную |
--generation-config vllm | Игнорировать generation_config.json из репозитория модели |
--served-model-name my-model | Задать короткое имя модели для поля model в запросах |
| Размерность | Плюсы | Минусы |
|---|---|---|
| 384–768 | Меньше памяти, быстрее поиск, дешевле хранение | Может терять тонкие семантические различия |
| 1024–1536 | Хороший баланс для большинства задач | Умеренные требования к ресурсам |
| 3072+ | Максимальная выразительность | Дороже хранение, медленнее brute-force поиск, не всегда даёт прирост качества |
| Формат | Что квантуется | Типичное применение |
|---|---|---|
| W8A8 | Веса и активации в 8 бит | FP8-инференс на Hopper/Ada |
| W4A16 | Только веса в 4 бита, активации остаются в 16 бит | GPTQ, AWQ |
| W4A8 | Веса в 4 бита, активации в 8 бит | Экспериментальные форматы |
| W8A8 (INT8) | Веса и активации в 8 бит (целочисленные) | INT8-схемы |