ITNEWS.pro
1 час назад
Подписаться
Разоблачение Ox Alpha. Z.ai подтвердила, что анонимного лидера OpenRouter выпустила она

Одними высокими показателями новых нейросетей сегодня уже трудно кого-то удивить. Модели стали настолько сильными, что прибавка в несколько процентов на бенчмарках воспринимается скорее как норма, а не как сенсация. Поэтому лаборатории всё чаще конкурируют не только возможностями моделей, но и тем, как они выводят их на рынок.

Один из самых громких маркетинговых ходов последних недель сделала китайская Z.ai, также известная как Zhipu AI. Компания подтвердила, что анонимная модель Ox Alpha, которая около недели держалась в лидерах OpenRouter — платформы с единым API для моделей разных разработчиков, — была её собственной разработкой: GLM-5.3-Flash.

Мы уже писали об этой модели, когда никто не знал ее автора, а только строили предположения. Нейросеть нашумела, дело в том, что тесты на десяти задачах DeepSWE давали ей 80% успешных решений. Теперь у детектива есть развязка. Модель бесплатно появилась на OpenRouter и терминальном агенте для программирования OpenCode под техническим именем stealth/ox-alpha. Сообщество принялось искать следы: разработчик под ником dax сравнил токенизацию на четверти сотни запросов и нашел почти полное совпадение с семейством GLM, расхождение стабильно составляло 75 служебных токенов. К этой улике добавились похожее поведение видеокодировщика и характерные ошибки, уже замеченные у китайских моделей. И вот производитель стал известен, а на Hugging Face (площадка для публикации моделей и датасетов) выложили веса под открытой лицензией MIT.

Скрытый релиз дал компании миллионы рабочих сессий без клейма бренда: разработчики сравнивали Ox Alpha с Claude, GPT и Grok на реальных задачах, а не по репутации создателя. Разочарует модель — промах никто не свяжет с именем Z.ai, удивит — шумиха в сообществе обойдется дешевле любой рекламной кампании. Так и вышло: азарт вокруг безымянной нейросети за неделю принес ей известность без серьезных вложений в рекламу.

Прием при этом далеко не новый и не китайский по происхождению. Первой его опробовала OpenAI: весной 2025 года под именами Quasar Alpha и Optimus Alpha на том же OpenRouter тестировался будущий GPT-4.1, и правда всплыла только после официального запуска. Дальше эстафету перехватили китайские разработчики и довели прием почти до конвейера. Под маской Pony Alpha скрывалась GLM-5 той же Zhipu, под именами Hunter Alpha и Healer Alpha в один день раскрылись сразу два флагмана Xiaomi — MiMo-V2-Pro и MiMo-V2-Omni, а Elephant Alpha и Owl Alpha оказались моделями Ling-2.6-flash от Ant Group и LongCat-2.0 от Meituan. По подсчетам аналитиков рынка, с апреля 2025 года через OpenRouter под псевдонимами прошло уже четырнадцать моделей, и Ox Alpha — лишь последняя запись в этом списке.

По устройству GLM-5.3-Flash — классический MoE (Mixture of Experts, архитектура, где на каждый запрос включается только часть блоков огромной модели): всего у нее 320 миллиардов параметров, но одновременно работают лишь 18 миллиардов, что заметно снижает вычислительные затраты на ответ. Модель принимает текст, изображения и видео, отвечает текстом, держит контекст на миллион с лишним токенов и генерирует до 131 072 токенов за раз. За длинный контекст отвечает гибридное внимание KDA — сочетание линейной и разреженной архитектуры, которое, по данным Z.ai, втрое снижает вычисления на внимание и в 4,4 раза уменьшает объем кэша. Отдельная деталь для рынка чипов: неделю бесплатного теста, по словам компании, модель отработала целиком на китайских ускорителях, без единой карты Nvidia — заметный штрих на фоне американского экспортного контроля.

Масштаб теста подтверждают цифры. К 23 августа через Ox Alpha прошло около 16 триллионов токенов, ею воспользовались 221 тысяча разработчиков, а счетчик сессий перевалил за 5 миллионов. К моменту официального раскрытия объем вырос на порядок: по оценкам изданий, следивших за запуском, недельный трафик составил уже несколько десятков триллионов токенов, и по этому показателю Ox Alpha обошла DeepSeek — прежнего лидера бесплатных моделей на OpenRouter.

Цену приятно удивляет: $0,15 за миллион входных токенов и $0,50 за миллион выходных — примерно десятая часть того, что Z.ai берет за старшую GLM-5.3 ($1,40 и $4,40 соответственно). До 9 сентября действует стартовая скидка 50%, так что запуск агента через API обходится в $0,075 и $0,25 за миллион токенов. Для сравнения: по расчетам VentureBeat, связка из миллиона входных и миллиона выходных токенов у Claude Opus 5 стоит около $30, у GPT-5.6 Sol — около $35, у Grok 4.6 — около $8, а у самой GLM-5.3 — $5,80. На этом фоне GLM-5.3-Flash за $0,65 без скидки и $0,325 со скидкой выглядит не конкуренцией, а демпингом.

По собственным тестам Z.ai, Flash далеко обошла предыдущее поколение GLM-5.2: на DeepSWE (тест на реальную работу с кодовой базой) результат вырос с 46,2% до 63,4%, на TerminalBench (агент в терминальной среде) — с 81% до 84,3%, на AutomationBench (многошаговая автоматизация) — почти вдвое, с 26,2% до 48,8%. По терминальным задачам показатель почти сравнялся с Claude Opus 4.8 (85%). Независимая проверка скромнее: на полном наборе из 113 задач DeepSWE результат Ox Alpha просел до 58–63% против ранних 80% на выборке в десять задач, а на KingBench (неофициальный набор задач для сравнения моделей в кодинге) модель набрала 87,5% против 91,25% у полной GLM-5.3. Получается не превосходство, а компромисс: агентные задачи и миллионный контекст модель тянет уверенно и дешево.

Подписывайся на наш Telegram и не пропусти главные новости!