Важно Обновление модели Zer0Kernel: переход на Qwen3.6-27B

1786787732580.png


Было:

QuantTrio/Qwen3-Coder-30B-A3B-Instruct-AWQ

Стало:

Intel/Qwen3.6-27B-int4-AutoRound

Почему решили перейти​

Qwen3-Coder-30B-A3B очень быстро отвечал, но модель достаточно "тупая", также авторы этой модели предупреждали о сильном потере качества ответов при квантовании.
Также эта модель не поддерживала рассуждения, на текущем железе можно что-то и более интересное запустить.)


Что стало лучше​

  • Более сильное рассуждение. Qwen3.6 поддерживает полноценный reasoning/thinking-режим, которого не было у предыдущей Qwen3-Coder.
  • Лучше работает с терминалом и инструментами. Это важно для анализа Linux-систем, Docker, логов, исходного кода и результатов security-инструментов.
  • Лучше понимает большие проекты. Новая модель сильнее в задачах, где необходимо анализировать не один файл, а связи между несколькими частями репозитория.
  • Более современное поколение Qwen. Qwen3.6 получила улучшения в coding, tool calling, repository reasoning и работе с длительными задачами.
  • Качественная INT4-версия от Intel. AutoRound позволяет запустить полноценную 27B-модель локально на одной видеокарте с 24 ГБ VRAM.

Почему 27B лучше старой 30B?​

Число в названии здесь немного обманчиво.

Старая Qwen3-Coder-30B-A3B использовала архитектуру Mixture-of-Experts. Несмотря на 30 млрд параметров всего, при генерации одновременно использовалась лишь небольшая их часть — около 3 млрд.

Новая Qwen3.6-27B — гораздо более тяжёлая модель, использующая существенно большую часть своих возможностей при каждом запросе.

Поэтому переход:

30B → 27B

на практике не является уменьшением модели. Скорее наоборот — Zer0Kernel получил более мощный AI-backend ценой более высокой нагрузки на GPU.

Что получилось на практике​

Текущая конфигурация Zer0Kernel работает с:
  • Qwen3.6-27B INT4
  • контекстом до 65 536 токенов
  • поддержкой Tool Calling
  • поддержкой Reasoning
  • Prefix Cache
  • FP8 KV Cache
  • CPU KV Offload
  • скоростью около 42–43 токенов/с
И всё это работает локально на одной видеокарте примерно с 24 ГБ VRAM.

Итог​

Главная причина перехода проста:

Улучшить качество ответов и максимально использовать текущее железо

Для Zer0Kernel теперь важнее не максимальная скорость генерации кода, а способность модели самостоятельно разбираться в сложных технических задачах, анализировать контекст, использовать инструменты и последовательно выполнять несколько шагов.

Итого скорость ответов в разы стало медленнее, но качество ответов должно-быть лучше.
 
Назад
Верх Низ