Сейчас можно бесплатно использовать пять моделей:
Отличается ещё и тем-что логи нигде не сохраняются, т.е. максимальная приватность.
Это облачная модель, работет через сервис OpenRouter.
Примечательно тем-что у неё увеличен контекст, т.е. можно спрашивать действительно какие-то длинные запросы...)
Основана на GLM-5.3 Flash — это новая открытая мультимодальная модель от китайской Z.ai (бывшая Zhipu AI), выпущенная 26 августа 2026 года.
По позиционированию это не «маленькая Flash-модель», а очень крупная MoE-модель, оптимизированная так, чтобы при инференсе активировалась лишь небольшая часть параметров.
Главные характеристики:
- 320 млрд параметров всего, но примерно 18 млрд активных на токен.
- Нативная мультимодальность — текст + изображения/визуальные задачи.
- Контекст порядка 1 млн+ токенов; OpenRouter сейчас показывает до ~1.31M для соответствующего маршрута.
- Особенно ориентирована на программирование, tool calling, агентов и длинные многошаговые задачи.
- Использует гибрид sparse attention + linear attention, чтобы дешевле обрабатывать огромный контекст.
- Обучалась с использованием нового мультимодального корпуса примерно на 30 трлн токенов.
- Веса опубликованы, официально заявлена поддержка vLLM, SGLang и TokenSpeed.
Почему вокруг неё сейчас столько шума
Перед официальным релизом Z.ai анонимно выставила эту модель под именемox-alpha в OpenRouter и OpenCode. Пользователи не знали, что это GLM. По заявлению Z.ai, во время этого теста она стала одной из самых популярных моделей недели.
Основная идея была такая:
Качество близкое к очень дорогим frontier-моделям → цена уровня дешёвой Flash-модели.
В общем интересно попробовать, мне понравилось, очень хорошо отвечает...)
👁 Что ещё ?
Также до сех-пор доступна модель kimi-k2.6 и бесплатная от OpenRouter.
