Z.ai представила GLM-5.3-Flash — первую модель серии GLM-5, которая изначально обучалась работать не только с текстом, но и с изображениями и видео. Стандартная цена через API составила $0,15 за миллион входных и $0,50 за миллион выходных токенов.
До официального релиза компания несколько дней тестировала модель под названием Ox Alpha в OpenCode и OpenRouter. Пользователи не знали, кто ее разработал, а Z.ai собирала отзывы на реальных задачах. По данным компании, за эту неделю Ox Alpha стала самой популярной моделью на площадках, а все запросы обрабатывались на китайских ИИ-чипах.
После теста Z.ai раскрыла модель как GLM-5.3-Flash. Компания уменьшила объем вычислений, необходимых для каждого ответа: из 320 млрд параметров модели одновременно работают 18 млрд. Это позволило снизить стоимость длинных задач с кодом и большими документами без перехода на совсем небольшую модель. GLM-5.3-Flash может удерживать в одной задаче до 1 млн токенов.
В тесте программирования DeepSWE новая модель набрала 63,4% против 46,2% у GLM-5.2 и 58% у Claude Opus 4.8. В тесте на выполнение последовательности действий AutomationBench результат составил 48,8% против 26,2% и 41% соответственно. Во внутреннем тесте Z.ai на максимальных настройках GLM-5.3-Flash получила 29 баллов против 29,5 у Opus 4.8. Эти показатели зависят от условий каждого теста и не означают одинакового преимущества на всех рабочих задачах.

Модель сможет использовать визуальный результат как часть работы: например, написать интерфейс, открыть его, заметить проблемы с расположением элементов и внести исправления. Z.ai отдельно обучала ее таким циклам для сайтов, игр и других интерактивных проектов.
GLM-5.3-Flash уже доступна пользователям GLM Coding Plan, где получила втрое больший включенный лимит, чем GLM-5.3. Z.ai также открыла веса модели на Hugging Face под лицензией MIT, поэтому компании смогут развернуть ее на собственной инфраструктуре.
Источник: Z.ai