Открытая китайская модель GLM-5.3 от Z.ai обнаружила уязвимость в редакторе кода Cursor и на тесте CyberGym почти достигла уровня ведущих закрытых систем США. CyberGym измеряет, может ли модель по доступному исходному коду найти и подтвердить уязвимость: GLM-5.3 набрала 84,5%, превысив заявленные результаты Claude Mythos 5 от Anthropic (83,8%) и GPT-5.6 Sol от OpenAI (83,6%). Вместе с августовским релизом Z.ai опубликовала реестр из 2 436 найденных уязвимостей в 269 open-source проектах, включая Linux, WebKit и FreeBSD, из них 1 097 компания отнесла к критическим. Но это не означает полного паритета: на ExploitBench, где нужно не только обнаружить проблему, но и построить рабочий эксплойт, GLM-5.3 получила 54,4% против 78% у Mythos 5 и 76,5% у GPT-5.6 Sol. Иными словами, модель уже почти на уровне лучших закрытых систем в аудите чужого кода, но пока заметно слабее в глубокой эксплуатации найденных уязвимостей.
Этот эпизод — не единичный. ИИ-компании из Китая вплотную приблизились к западным лидерам. С середины июля по середину августа лаборатории из Поднебесной выпустили подряд несколько моделей, которые в разных дисциплинах садятся на одну скамью с американскими флагманами: Kimi K3 от Moonshot AI, Qwen3.8-Max от Alibaba, GLM-5.3 от Z.ai и обновленную линейку DeepSeek V4. Именно эта плотность релизов от разных производителей убеждает аналитиков, что разрыв с США сокращается быстрее, чем казалось год назад.
На тестах Stanford HAI (междисциплинарный институт Стэнфордского университета по ИИ) фиксирует, что разница между лучшими американскими и китайскими моделями на агрегированном лидерборде Arena сузилась до нескольких процентных пунктов — порядка 2,7% по мартовскому срезу. Свежая выборка Artificial Analysis на середину августа рисует ту же картину: GPT-5.6 Sol набирает 89,5%, Claude Opus 5 — 89,1%, а лучшая китайская модель, Kimi K3, — 85,0%, Qwen3.8-Max — 81,3%. Дистанция все еще есть, но она уже не в разы, а в единицы процентных пунктов. При этом картина неравномерная. Qwen3.8-Max показывает 86,1 балла на OSWorld-Verified (тест, где ИИ должен выполнять реальные задачи за компьютером через интерфейсы приложений и браузер: работать с файлами, таблицами, настройками и сайтами). Это выше заявленных результатов GPT-5.6 Sol Max (83,2), Claude Fable 5 (85,0) и Gemini 3.1 Pro (76,2). На PaperBench (тест на воспроизведение научных работ по ИИ, где агент по одной статье должен с нуля реализовать метод, запустить эксперименты и приблизиться к результатам авторов) Qwen3.8-Max набирает 93,0.
На более сложных задачах разработки ПО соотношение меняется. На SWE-bench Pro (набор реальных инженерных задач из GitHub, где модель должна разобраться в кодовой базе и подготовить патч, исправляющий баг или реализующий требуемое изменение) Qwen3.8-Max получает 67,7% против 80,0% у Claude Fable 5. На FrontierSWE (серьезный тест длительной агентной разработки в реальных репозиториях, где необходимо работать с крупным проектом, терминалом, тестами и несколькими взаимосвязанными изменениями) Qwen3.8-Max набирает 73,5%, тогда как Claude Fable 5 достигает 88,8%. Это показывает, что китайские модели уже способны обходить американские флагманы в отдельных компьютерных и исследовательских задачах, но в глубокой, долгой работе над реальным ПО пока заметно уступает.
За счет чего вырос темп. Первая причина — архитектурная: почти все новые китайские флагманы построены на архитектуре «смесь экспертов» (Mixture-of-Experts, MoE), где из триллионов параметров на каждый токен реально работает малая доля сети. У Kimi K3 это 2,8 трлн параметров общей емкости при активации лишь 16 из 896 экспертов на токен. Модель имеет контекстное окно в 1 миллион токенов, нативное визуальное восприятие и активирует лишь 16 из 896 своих экспертов в момент, что составляет примерно 1,8% от всего пула. Qwen3.8-Max имеет в общей сложности 2,4 триллиона параметров, но активирует лишь 95 миллиардов на токен, используя разреженную архитектуру смеси экспертов, которая уменьшает вычислительные затраты на каждый запрос по сравнению с заявленным общим числом параметров. Это снижает стоимость вычисления на токен и позволяет лабораториям с ограниченным доступом к передовым ускорителям выжимать из имеющегося «железа» больше.
Вторая причина — ставка на дообучение поверх готовой базы вместо дорогого предобучения с нуля: GLM-5.3 использует ту же основу на 743 млрд параметров, что и GLM-5.2, а рост примерно на 50% в кодинге и шестикратный скачок на Terminal-Bench 3.0 получены исключительно через посттренинг.
Третья причина — открытые веса как стратегия завоевания рынка разработки: китайские модели заняли больше 60% токенной доли на OpenRouter (единый API-посредник и маркетплейс моделей) в июне именно за счет агрессивной цены и доступности весов.
И четвертая — параллельность: когда Moonshot, Alibaba, Z.ai и DeepSeek выпускают сопоставимые релизы почти одновременно, задержка или неудача одной лаборатории уже не тормозит весь сегмент.
Ни одна из этих цифр не отменяет главного ограничения. Почти все китайские бенчмарки в этом материале — самоотчет лабораторий. Независимой перепроверки Artificial Analysis или LMArena большинство из них пока не прошли. Плюс доступ к передовым ускорителям и вычислительным кластерам у США по-прежнему шире, а открытые веса — не то же самое, что открытый код обучения: данные и методика посттренинга у большинства этих моделей остаются закрытыми.
