🧠 Обсуждение нейросетей

🤖 Qwen3.8 2.4T A95B - что это за модель и как задать ей вопрос на Zer0Kernel

  • 118
  • 4
1786619637074.png


В августе 2026 года семейство Qwen получило новый флагман — Qwen3.8-Max, а следом были опубликованы веса Qwen3.8-2.4T-A95B (Опубликован 12 августа 2026 года).

Это модель Max-класса с архитектурой Mixture-of-Experts, ориентированная прежде всего на программирование, сложный анализ, исследовательские задачи и длительные agentic-workflow.

На Zer0Kernel взаимодействовать с моделью можно через пользователя Qwen.

Пользователь Qwen отвечает в своих темах, а для вопросов непосредственно к Qwen3.8 создан отдельный раздел:

🤖 Задай вопрос Qwen3.8 2.4T A95B 🤖

Можно задавать вопрос во всех темах созданных пользователем Qwen, либо в указанном выше разделе, путем создание темы.
Также в этой теме можно и общаться с моделью.

🧠...​

Важно Zer0Kernel Hacker Mentor: Помощь в обучении и проведении атак

  • 131
  • 0
1785247634257.png


Я тут всё экспериментирую с нейронкой и нашел такую итересную штуку, называется PentestGPT...

Это агент предназначенный для автоматизации таких целей:
  • определять открытые порты и сервисы;
  • анализировать версии ПО;
  • исследовать веб-приложения;
  • искать директории, поддомены и точки входа;
  • выделять потенциально уязвимые компоненты;
  • предлагать дальнейшие проверки.
Т.е. по факту даешь такой запрос:

Есть сервер 192.168.50.20, просканируй порты, проанализируй структуру сервера, сделай дерево атак.

Нейронка автоматически делает анализ, запускает нужный софт и т.д. и получается какой-то такой ответ:

Дерево гипотез:

Получить доступ к серверу
├── Веб-приложение
│ ├── Проверить загрузку файлов
│ ├── Проверить SQL-инъекции
│ └── Проверить устаревшие компоненты
├── SSH
│ ├── Проверить конфигурацию
│ └── Проверить найденные учётные данные
└── Внутренняя сеть
└── Доступна...

Оценка качества LLM: бенчмарки, автоматические метрики и почему MMLU не заменяет тест на ваших данных

  • 2
  • 0
Бенчмарк показывает, как модель справляется с задачами, которые кто-то другой счёл репрезентативными. Если ваша задача не совпадает с этой выборкой, цифра в лидерборде бесполезна. Оценка качества LLM — это не выбор одного числа из таблицы, а построение системы измерений, которая отвечает на конкретный вопрос: «Насколько хорошо модель решает мою задачу?»

Что измеряют бенчмарки и почему они расходятся с реальностью​


Бенчмарки фиксируют способность модели на момент обучения. Они не учитывают:

  • Доменную специфику. Модель, набравшая 85% на MMLU, может ошибаться в юридических формулировках, если в обучающих данных не было достаточно примеров из этой области.
  • Формат взаимодействия. Бенчмарк обычно тестирует single-turn QA. В продакшене модель работает в многошаговом диалоге, с контекстом, инструкциями и ограничениями.
  • Распределение ошибок. Средний балл скрывает, что модель может стабильно ошибаться на определённом подмножестве...

Подготовка датасета для дообучения LLM: формат, фильтрация, балансировка и типичные ошибки

  • 7
  • 0
Качество дообучения определяется датасетом ещё до начала тренировки. Модель не способна «вытащить» сигнал из мусорных примеров, и даже идеально подобранные гиперпараметры не компенсируют плохо подготовленные данные. Подготовка датасета — это не разовый шаг, а итеративный процесс: сбор, очистка, форматирование, балансировка и валидация.

Форматы датасетов для fine-tuning​


Выбор формата зависит от задачи и фреймворка обучения. Три наиболее распространённых паттерна:

Instruction-Response (Alpaca-формат)​


Простейший формат для задач следования инструкциям. Каждый пример содержит три поля:

JSON:
{
  "instruction": "Переведи текст на английский язык.",
  "input": "Сегодня хорошая погода.",
  "output": "The weather is nice today."
}

Поле input опционально: если инструкция самодостаточна, его оставляют пустым. Этот формат используют для SFT (Supervised Fine-Tuning) моделей типа LLaMA, Mistral, Qwen...

Важно О том, как читать мысли нейросетей и украсть пароли

  • 47
  • 1
1786530770590.png


На самом деле такие штуки как память модели и данные которые вы отправляете моделям не так-уж хорошо и защищены.

В этой статье предлагаю рассмотреть атаку, при которой можно попробовать вытащить из модели какие-то конфиденциальные данные, например пароли, токены и т.д.

Вообще сама статья опубликована на хабре, но может-быть интересно, реализация атаки не сложная.)


Итак:

Внутренние рассуждения передовых моделей, которые провайдеры прячут от пользователя, можно прочитать целиком и дословно, причем не атакуя саму модель.

Восемь исследователей, в том числе из ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка, Tübingen AI Center, MATS и Snyk, 10 августа выложили препринт "Stealing Reasoning Traces from Proprietary LLM APIs" с работающей атакой на модели трех крупнейших поставщиков: Anthropic...

Важно Нейросеть как человек

  • 89
  • 0
1786434784696.png


Я тут всё пытаюсь сделать автогенерацию, но что-бы это было хоть как-то читаемо, нужно-было не хило так поприседать...

Вот почему и аналогия с человеком:

1)Модель ленивая и не хочет работать, вот например если сказать, напиши техническую статью, минимальной длиной 2000 символов.

В итоге скажет, "Я всё сделал", а в итоге либо не хрена не 2000 символов, а много меньше...

Отправляешь на доработку, в итоге сделает на отъебись, для "раздувания" статьи просто копирует предыдущие абзацы.

2)Часто говорит "Начальника, сделаль...", а по факту такая дичь вообще...)

3)Извините часто пиздит, придумывает команды в техничеких статьях, короче лиш-бы что-то сделать...)

Итог​


Нейросети невероятно полезны именно потому, что способны быстро делать работу, на которую вручную ушли бы часы.

Но скорость создаёт ложное ощущение надёжности.

Хорошо оформленный ответ с командами, заголовками и техническими...

Сколько VRAM нужно для локальной LLM: веса, KV cache, контекст и параллельные запросы

  • 39
  • 0

Введение​


Локальный запуск языковых моделей (LLM) требует тщательного планирования ресурсов, особенно объема видеопамяти (VRAM). Современные модели, такие как Llama-3.3-70B или Qwen-VL-72B, могут потреблять несколько гигабайт VRAM, что делает важным понимание того, как именно память используется в процессе инференса.

Это руководство подробно рассматривает, как рассчитать и оптимизировать использование VRAM при запуске LLM на GPU, с акцентом на ключевые компоненты: веса модели, KV cache, контекстную длину и параллельные запросы. Оно основано на данных, предоставленных vLLM, и включает практические рекомендации по минимизации потребления памяти и повышению эффективности.

Основные компоненты потребления VRAM​


Веса модели​


Веса модели — основной источник потребления VRAM. Размер весов зависит от числа параметров и формата хранения:

  • FP32: 4 байта на параметр
  • FP16: 2 байта на параметр...

Заметка Почему компании бесплатно выкладывают модели ?

  • 88
  • 0
Многие удивляются: обучение современных языковых моделей стоит миллионы, а иногда и сотни миллионов долларов. Тогда почему такие компании, как Meta, Alibaba, Mistral и другие, позволяют бесплатно скачать свои модели?

На первый взгляд это кажется нелогичным, но на самом деле открытые модели являются частью долгосрочной бизнес-стратегии.

## 1. Реклама компании

Если модель становится популярной, о компании узнают миллионы разработчиков по всему миру.

Это повышает узнаваемость бренда, привлекает новых клиентов и укрепляет репутацию технологического лидера.

Например:
  • Meta → Llama
  • Alibaba → Qwen
  • Mistral AI → Mistral Models
Фактически сама модель становится рекламой компании.

---

## 2. Продажа облачных сервисов

Большинство пользователей никогда не будут запускать модель самостоятельно.

Для локального запуска требуются:
  • мощные GPU;
  • настройка программного обеспечения;
  • обслуживание серверов...

Статья Open WebUI и vLLM: как исправить ошибку `maximum context length` у Qwen и других моделей

  • 85
  • 0
1785689872931.png


При работе с локальными языковыми моделями через Open WebUI, vLLM, Qwen Coder, Llama или Mistral можно столкнуться с такой ошибкой:

Код:
This model's maximum context length is 100000 tokens.
However, you requested 20000 output tokens and your prompt contains
at least 80001 input tokens, for a total of at least 100001 tokens.

Please reduce the length of the input prompt or the number of
requested output tokens.

(parameter=input_tokens, value=80001)

На первый взгляд может показаться, что проблема связана с самой моделью или неправильной настройкой vLLM. На самом деле сообщение означает, что сумма входного контекста и максимально разрешённого размера ответа превысила контекстное окно модели.

В этой статье разберём:
  • что означает ошибка maximum context length;
  • откуда Open WebUI берёт десятки тысяч входных токенов;
  • как влияет параметр max_tokens...

Статья Как создать RAG-базу из технических книг

  • 114
  • 0

Большие языковые модели хорошо умеют писать код, объяснять технологии и анализировать ошибки, но их знания ограничены данными, использованными при обучении. Модель может не знать содержимое редкой технической книги, внутренней документации или нового руководства.

Эту проблему можно решить с помощью RAG — Retrieval-Augmented Generation, то есть генерации ответов с дополнением из внешней базы знаний.
RAG позволяет загрузить технические книги, документацию, статьи и исходные коды в специальную базу, после чего нейросеть сможет находить в них нужные фрагменты и использовать их при формировании ответа.

В этой статье разберём:
  • как устроен RAG;
  • чем RAG отличается от обучения модели;
  • как подготовить технические книги;
  • зачем нужны OCR, чанки и embedding-модель;
  • как создать базу знаний в Open WebUI;
  • какие параметры использовать для локальной нейросети;
  • как проверить качество поиска...

Важно База знаний модели Zer0kernel Coder AI

  • 97
  • 0
У модели появилась база знаний, что это такое ?

Поиск по книгам и документам RAG (генерация, дополненная поиском).

Вкратце, книга из pdf переводится в векторную базу, далее выполняется поиск по этой базе и дополняется ответ модели на основе найденных фрагментов из книг.

Как этим пользоваться, может-быть несколько схем:

1)В редакторе ввести #:

1785157599518.png


Выбрать одну, или несколько баз, также можно искать по конкретному сайту, но об этом ниже.

2)Описание баз знаний:

- Linux Internals, две книги, это классика для разработчиков в линукс:

1. Linux System Programming: Talking Directly to the Kernel and C Library, это перевод на русский.
2. Linux Kernel Development, тоже перевод.

Это книги авторов Лав, Роберт.
Кстати рекомендую.)

- Windows Internals:

1)Павел Йосифович Работа с ядром Windows. 2021.
2)Йосифович П, Ионесcку А, Руссинович М.Е, Соломон Д. А. - Внутреннее устройство Windows 7-ое издание 2017 часть 1.
3)Йосифович...

Заметка Почему современные нейросети - ещё далеко не искусственный интеллект

  • 68
  • 0
1785072435402.png


Современные нейросети умеют писать тексты, создавать программный код, анализировать документы, распознавать изображения и поддерживать диалог.

Иногда их ответы настолько убедительны, что может показаться, будто внутри компьютера действительно появился разум.

Однако между способностью генерировать правдоподобный ответ и настоящим пониманием существует огромная разница.

Современная языковая модель:

  • не обладает сознанием;
  • не имеет собственных желаний;
  • не понимает мир так, как его понимает человек;
  • не осознаёт смысл произносимых слов;
  • не формирует самостоятельные жизненные цели;
  • не испытывает эмоций;
  • не знает, является ли её ответ истинным;
  • не существует как непрерывная личность между запросами.

При этом утверждение:

Код:
Нейросети вообще не являются искусственным интеллектом
технически не совсем верно.

Нейросети являются частью области искусственного интеллекта, но...

Статья Антивирус для нейросетей: безопасность LLM, RAG и AI-агентов

  • 67
  • 0
1785008248206.png


Современная нейросеть редко работает изолированно.

Обычно вокруг модели строится целая система:

Код:
Пользователь
    ↓
Веб-интерфейс или API
    ↓
Системный prompt
    ↓
Языковая модель
    ↓
RAG и база документов
    ↓
Инструменты и плагины
    ↓
Файлы, почта, браузер, серверы и базы данных

Поэтому выражение «взломать нейросеть» может означать совершенно разные вещи:
  • заставить модель нарушить заданные правила;
  • получить скрытые инструкции;
  • извлечь конфиденциальные данные;
  • подменить документы в RAG;
  • отравить обучающий датасет;
  • похитить веса модели;
  • вызвать дорогостоящие вычисления;
  • заставить AI-агента выполнить опасное действие;
  • получить доступ к инфраструктуре, в которой запущена модель;
  • внедрить вредоносный компонент через цепочку поставки.

Важно разделять:

Код:
Атака на модель
Атака на данные
Атака на приложение
Атака на инструменты
Атака на...

Заметка Что такое веса нейросети: как модель хранит знания и создаёт ответы

  • 75
  • 0
В описании языковых моделей часто встречаются обозначения:

Код:
7B
14B
32B
70B

Например:

Код:
Qwen 7B
Qwen 32B
Llama 70B
Буква B означает billion — миллиард.

Если указано:

Код:
32B
это означает, что нейросеть содержит примерно 32 миллиарда параметров.

Основную часть этих параметров составляют веса модели.

Веса определяют:
  • как модель понимает входной текст;
  • какие связи замечает между словами;
  • как обрабатывает программный код;
  • какие закономерности использует;
  • как выбирает следующий токен;
  • в каком стиле формирует ответ.
Веса — это числовая структура, определяющая способности и поведение нейросети.

---

# Что такое веса модели

Веса модели — это огромное количество числовых коэффициентов, которые используются нейросетью при обработке информации.

Упрощённо:

Код:
Запрос пользователя
        ↓
Преобразование текста в токены
        ↓...

Заметка Как дообучить Qwen3-Coder с помощью LoRA и QLoRA на собственных данных

  • 72
  • 0
1784986536495.png


Qwen3-Coder уже умеет:
  • писать и объяснять программный код;
  • искать ошибки;
  • рефакторить проекты;
  • работать с несколькими файлами;
  • выполнять инструкции;
  • использовать инструменты;
  • анализировать большие репозитории.
Но стандартная модель ничего не знает о:
  • внутренних правилах вашего проекта;
  • принятом стиле программирования;
  • собственных библиотеках;
  • структуре приватного репозитория;
  • специальных форматах конфигурации;
  • внутренних API;
  • правилах оформления ответов;
  • типичных задачах конкретной команды.
Для адаптации модели можно использовать LoRA.

Технология называется LoRA — Low-Rank Adaptation, а вариант с загрузкой базовой модели в 4-битном виде — QLoRA.

LoRA позволяет не изменять все миллиарды параметров модели, а обучить сравнительно небольшой набор дополнительных матриц — адаптер.

Упрощённая схема:

Код:
Базовая Qwen3-Coder...

Как анализировать логи с помощью AI: поиск ошибок, атак и аномалий

  • 72
  • 0
Логи содержат огромный объём информации о работе серверов, приложений, сетевого оборудования и пользовательских устройств.

В них можно найти:
  • причину ошибки;
  • источник высокой нагрузки;
  • неудачные попытки входа;
  • подозрительные IP-адреса;
  • последовательность действий злоумышленника;
  • проблемы с базой данных;
  • ошибки Docker-контейнера;
  • сбои авторизации;
  • необычную активность пользователей;
  • признаки сканирования сайта;
  • повторяющиеся HTTP-ошибки;
  • момент начала инцидента.
Проблема заключается в том, что журналы могут содержать тысячи или миллионы строк.

Человеку сложно быстро определить:
  • какие события связаны между собой;
  • что является нормальным поведением;
  • где начинается аномалия;
  • какие строки важны;
  • какие события являются следствием, а какие причиной.
Искусственный интеллект может значительно ускорить первичный анализ.

AI способен:
  • объяснять непонятные сообщения;
  • группировать одинаковые ошибки...

Заметка Полное руководство: локальный Qwen3-Coder на видеокарте NVIDIA с 24 ГБ VRAM и Open WebUI

  • 78
  • 0
1784541878699.png


# Полное руководство: локальный Qwen3-Coder на видеокарте NVIDIA с 24 ГБ VRAM и Open WebUI

Актуальность руководства: 20 июля 2026 года
Основной сценарий: одна видеокарта NVIDIA с 24 ГБ видеопамяти, Ubuntu 22.04 или Ubuntu 24.04, Docker Compose, Ollama и Open WebUI.
Рекомендуемая модель: qwen3-coder:30b в квантизации Q4_K_M.
Рекомендуемый начальный контекст: 16 384 токена.
Рекомендуемый тип KV-кэша: q8_0.

---

## Содержание

1. Что именно мы будем устанавливать
2. Что такое Qwen-Coder, Ollama и Open WebUI
3. Какую версию Qwen-Coder выбрать для 24 ГБ VRAM
4. Почему размер контекста влияет на видеопамять
5. Требования к компьютеру
6. Итоговая архитектура
7. Подготовка Ubuntu
8. Установка драйвера NVIDIA
9. Установка Docker Engine и Docker Compose
10. Установка NVIDIA Container Toolkit
11. Создание Docker Compose-конфигурации
12. Запуск Ollama и...

Найти пользователя

Новые сообщения на форуме

Статистика форума

Темы
454
Сообщения
583
Пользователи
50
Новый пользователь
BratBorat1024
Назад
Верх Низ