Мы обновили локальную AI-модель Zer0Kernel и переходим на Ternary-Bonsai-2-27B-Uncensored-Heretic в компактном формате PTQ1_0.
В основе модели лежит новая Bonsai 2 27B от PrismML, построенная на базе Qwen3.8-27B. Это полноценная модель класса 27B, ориентированная не только на обычный чат, но и на программирование, сложный анализ, reasoning, работу с инструментами и обработку изображений.
Главная особенность Bonsai 2 — ternary-веса {-1, 0, +1}. Благодаря специальному представлению PTQ1_0 языковая часть модели размером 27B занимает всего около 5.95 ГБ, то есть примерно в 9 раз меньше FP16-версии аналогичного размера. При этом PrismML заявляет сохранение около 98.2% совокупной производительности исходной Qwen3.8-27B по своему набору тестов.
Что умеет новая модель
• работа с текстом и программным кодом;
• встроенный reasoning — модель может выполнять более глубокий анализ перед ответом;
• анализ изображений и скриншотов;
• распознавание и разбор информации на изображениях и в документах;
• анализ интерфейсов, ошибок на скриншотах, схем и другого визуального материала;
• работа с tool calling и агентными сценариями;
• очень большой контекст — до 262 144 токенов.
Bonsai 2 изначально является мультимодальной моделью. Для обработки изображений используется отдельный vision-модуль. Его Q8-вариант занимает около 630 МБ и подключается только для работы с изображениями. Поэтому обычные текстовые запросы не требуют постоянно держать крупную отдельную vision-модель.
Контекст 262K
Максимальное контекстное окно модели составляет 262 144 токена.
Это позволяет работать с существенно более длинными диалогами, исходным кодом, документацией и большими объёмами переданного текста, чем раньше.
При этом часть окна всегда должна оставаться под собственный ответ и reasoning модели. В нашей конфигурации под генерацию ответа резервируется до 20 000 токенов, поэтому система заранее контролирует размер запроса и не отправляет модели заведомо переполненный контекст.
Анализ картинок
Теперь локальной модели можно передавать изображения.
Например, можно отправить:
• скриншот ошибки;
• изображение интерфейса программы;
• схему;
• график;
• фотографию;
• скрин терминала или кода;
• страницу документа;
• изображение с текстом для анализа.
Модель получает одновременно текстовый запрос и изображение и анализирует их в рамках одного диалога.
Vision-возможности являются частью самой архитектуры Bonsai 2. PrismML отдельно тестирует модель на задачах RealWorldQA, OCRBench, OmniDocBench и других vision-бенчмарках.
Что означает Uncensored Heretic
Используемая нами версия Ternary-Bonsai-2-27B-Uncensored-Heretic-PTQ1_0.gguf — это не официальный релиз PrismML, а модифицированная версия Bonsai 2.
В неё встроена Heretic LoRA, предназначенная для уменьшения количества необоснованных отказов модели.
Автор сборки указывает, что при модификации были изменены 34 матрицы, тогда как остальные 817 тензоров остались без изменений. Merge является приближённым: изменения были перенесены непосредственно в ternary-веса, а не выполнены как обычное FP-слияние LoRA.
По собственному тесту автора сборки:
Код:
Uncensored Heretic: 0 отказов из 100
Original Bonsai 2: 95 отказов из 100
Это результат конкретного теста автора модели и не следует воспринимать как универсальную оценку поведения на любых запросах.
PTQ1_0
Мы используем именно:
Код:
Ternary-Bonsai-2-27B-Uncensored-Heretic-PTQ1_0.gguf
PTQ1_0 хранит ternary-веса примерно с 1.75 эффективного бита на вес, а размер языковой модели составляет около 5.95 ГБ.
Для сравнения, официальный PQ2_0-вариант занимает около 7.21 ГБ. PTQ1_0 находится значительно ближе к теоретическому размеру ternary-представления.
Для работы этих форматов используются специальные ternary kernels и преобразования Hadamard, поэтому модель запускается через специальную ветку PrismML llama.cpp. Автор Uncensored Heretic также указывает именно этот runtime как необходимый для PTQ1_0 и PQ2_0.
Reasoning
Для локальной модели включён режим размышления.
По умолчанию используется:
Код:
reasoning: ON
reasoning effort: low
Это позволяет модели проводить внутренний анализ сложной задачи перед формированием основного ответа, но без чрезмерно длинного reasoning для обычных запросов.
Полностью локальная модель
Одна из главных особенностей этого обновления — модель работает непосредственно на нашей инфраструктуре.
То есть для обычного использования локальной Bonsai 2 запрос не требуется отправлять внешнему облачному AI-провайдеру. Это особенно полезно при работе с кодом, внутренними документами и другими данными, которые нежелательно передавать сторонним сервисам.
Кратко
Код:
Модель: Ternary-Bonsai-2-27B-Uncensored-Heretic
Формат: GGUF PTQ1_0
База: Qwen3.8-27B / Bonsai 2 27B
Параметры: ~27B
Размер языковой модели: ~5.95 ГБ
Контекст: до 262 144 токенов
Максимальный ответ Zer0Kernel: до 20 000 токенов
Reasoning: да, low
Изображения: да
Vision-модуль: Q8, ~0.63 ГБ
Tool Calling: да
Локальный запуск: да
Таким образом, новое обновление одновременно даёт нам 27B-класс модели, большой контекст 262K, reasoning, анализ изображений и существенно более свободное поведение — при очень небольшом для модели такого размера объёме весов.
Особенно интересно это должно быть для программирования, анализа больших проектов, работы со скриншотами и ошибками, длинных технических диалогов и задач, где обычного небольшого контекста уже недостаточно.
Также эта модель сейчас и в телеграмм боте и API.)
Последнее редактирование:
