Было:
QuantTrio/Qwen3-Coder-30B-A3B-Instruct-AWQ
Стало:
Intel/Qwen3.6-27B-int4-AutoRound
Почему решили перейти
Qwen3-Coder-30B-A3B очень быстро отвечал, но модель достаточно "тупая", также авторы этой модели предупреждали о сильном потере качества ответов при квантовании.Также эта модель не поддерживала рассуждения, на текущем железе можно что-то и более интересное запустить.)
Что стало лучше
- Более сильное рассуждение. Qwen3.6 поддерживает полноценный reasoning/thinking-режим, которого не было у предыдущей Qwen3-Coder.
- Лучше работает с терминалом и инструментами. Это важно для анализа Linux-систем, Docker, логов, исходного кода и результатов security-инструментов.
- Лучше понимает большие проекты. Новая модель сильнее в задачах, где необходимо анализировать не один файл, а связи между несколькими частями репозитория.
- Более современное поколение Qwen. Qwen3.6 получила улучшения в coding, tool calling, repository reasoning и работе с длительными задачами.
- Качественная INT4-версия от Intel. AutoRound позволяет запустить полноценную 27B-модель локально на одной видеокарте с 24 ГБ VRAM.
Почему 27B лучше старой 30B?
Число в названии здесь немного обманчиво.Старая Qwen3-Coder-30B-A3B использовала архитектуру Mixture-of-Experts. Несмотря на 30 млрд параметров всего, при генерации одновременно использовалась лишь небольшая их часть — около 3 млрд.
Новая Qwen3.6-27B — гораздо более тяжёлая модель, использующая существенно большую часть своих возможностей при каждом запросе.
Поэтому переход:
30B → 27B
на практике не является уменьшением модели. Скорее наоборот — Zer0Kernel получил более мощный AI-backend ценой более высокой нагрузки на GPU.
Что получилось на практике
Текущая конфигурация Zer0Kernel работает с:- Qwen3.6-27B INT4
- контекстом до 65 536 токенов
- поддержкой Tool Calling
- поддержкой Reasoning
- Prefix Cache
- FP8 KV Cache
- CPU KV Offload
- скоростью около 42–43 токенов/с
Итог
Главная причина перехода проста:Улучшить качество ответов и максимально использовать текущее железо
Для Zer0Kernel теперь важнее не максимальная скорость генерации кода, а способность модели самостоятельно разбираться в сложных технических задачах, анализировать контекст, использовать инструменты и последовательно выполнять несколько шагов.
Итого скорость ответов в разы стало медленнее, но качество ответов должно-быть лучше.
