Компания Илона Маска xAI выпустила Grok 4.6 — новую флагманскую модель. Она сразу заработала в редакторе кода с ИИ-помощником Cursor, в собственном агенте компании Grok Build, у разработчиков — через программный интерфейс xAI (API, канал прямого подключения к модели) и у партнеров OpenRouter, Vercel и Cloudflare. Маск в X назвал релиз «бомбой», а сама xAI заявила, что по интеллекту новинка сравнялась с GPT-5.6 Sol от OpenAI и Fable 5 от Anthropic, причем вышла примерно вдвое дешевле обеих. Цифры действительно впечатляют, но при ближайшем разборе картина оказывается заметно скромнее.
Grok 4.6 xAI позиционирует как модель для долгих агентных сценариев: работы с незнакомой кодовой базой, многошагового исследования темы, превращения сырой идеи продукта в рабочее приложение. По словам разработчиков, система стала чаще проверять собственные ответы по ходу задачи, а не выдавать один проход и останавливаться, и заметно увереннее справляется с визуальными и интерактивными проектами с первой попытки.
Добилась этого xAI не переобучением с нуля, а более долгим дополнительным циклом поверх линии Grok 4.5. На этапе обучения с учителем модель предыдущего поколения сама регенерировала обучающие траектории для разных уровней рассуждения, агентных сценариев и областей — от точных наук до разработки ПО, а слабые примеры отсеивались автоматической проверкой. Дальше шло обучение с подкреплением (RL, метод, при котором модель поощряется за успешные действия и штрафуется за ошибки) на задачах программирования, интеллектуального труда, оптимизации кода под конкретное железо и даже автоматизированного проектирования (CAD).
По сводному индексу независимой аналитической платформы Artificial Analysis, объединяющему девять разных тестов, Grok 4.6 в режиме высокой мощности набрал 61 балл — ровно столько же, сколько GPT-5.6 Sol на максимальных настройках. А вот заявление о равенстве с Anthropic не совсем справедливо. Claude Fable 5 Max опередил Grok на балл, а Claude Opus 5 Max — сразу на два. Про Opus 5 в релизе xAI вообще не упоминает.
По отдельным тестам расклад пестрый. Grok лидирует там, где важна выносливость в долгой задаче: в GDPVal-AA v2 (агентная интеллектуальная работа) у него 1753 балла против 1741 у Fable 5 Max, в тесте на длинные рабочие проекты AA-Briefcase — 1577 против 1574, а в юридическом тесте Harvey LAB модель обошла обоих конкурентов почти в полтора раза.
Там же, где меряют чистое программирование, преимущество исчезает. В DeepSWE — 65,9% против 70% у Fable 5 Max и 73% у GPT-5.6 Sol Max, а в Terminal-Bench v3.0 (работа в командной строке) Grok набрал лишь 26% против 34% с лишним у обоих соперников. В CursorBench, тесте на реальную работу с кодом в редакторе, Grok почти догнал Fable 5 Max — 69,9% против 70,5%.
Один результат заслуживает отдельного внимания. Задачи AA-Briefcase Grok 4.6 закрывал в среднем за 53 хода и около полумиллиарда входных токенов, тогда как Claude Opus 5 Max тратил на те же задачи порядка 103 хода и два миллиарда токенов. При сопоставимом качестве это вдвое меньше итераций и вчетверо меньше токенов, а значит, дешевле и надежнее в реальном агентном пайплайне, даже когда итоговый балл почти одинаков.
О чем xAI предпочла умолчать, так это о скорости первого ответа. Генерирует Grok 4.6 быстро, около 77,6 токена в секунду, но до появления первого символа ответа (TTFT, время до первого токена) проходит порядка 42 секунд против медианных 2,85 секунды у сопоставимых моделей. Для фонового агента, который час разбирает репозиторий, эта задержка не критична. Для живого диалога — заметный минус, который в анонсе не звучит вовсе. Плюс к этому модель остается закрытой: без публичных весов и независимого аудита обучения, а конкурентные цифры на графиках xAI взяты из чужих system card и лидербордов, а не получены самой компанией.
Цена у модели действительно низкая: $2 за миллион входных токенов и $6 за миллион выходных при контексте до 200 тысяч токенов, с удвоением ставки выше этого порога, а ускоренный тариф стоит еще вдвое дороже. Для сравнения, Claude Opus 5 по прайсу Artificial Analysis стоит $5 и $25, а GPT-5.6 Sol — $5 и $30 за миллион токенов. Реально дешевле, но формула «вдвое дешевле» верна только для базового тарифа и короткого контекста.
Grok 4.6 действительно закрыла разрыв с прошлым поколением и стала заметно дешевле конкурентов при сопоставимой агентной эффективности. Но «бомба» и «уровень лидеров» — это все-таки разные вещи. Следующую проверку боевому темпу xAI назначила сама: Grok 4.7 (по ожиданиям — модель на 2,1 триллиона параметров) должна выйти уже в ближайшие недели.
