Первый серверный чип OpenAI для вывода нейросетей (инференса) под названием Jalapeno топовые системы Nvidia на базе Blackwell по эффективности работы на ватт мощности, так утверждает сама компания. Разработку с нуля вели инженеры Ричард Хо, Рави Нараянасвами и Крис Лири, а путь от первых чертежей до готового кристалла занял около девяти месяцев — это короткий срок для микросхем такого класса.
OpenAI не разрабатывала аппаратную часть самостоятельно. За проектирование чипа и сетевой инфраструктуры отвечала Broadcom, а канадская Celestica собирала готовые серверные стойки. Сотрудничество началось после соглашения, подписанного в октябре 2025 года. Тогда компании договорились вместе создать специализированные ИИ-ускорители общей мощностью 10 гигаватт. Jalapeno стал первым результатом этой сделки. В OpenAI утверждают, что уже работают над вторым и третьим поколениями чипа.
По бенчмаркам из открытого набора InferenceX, который ведет аналитическая фирма SemiAnalysis, чип на моделях GPT-OSS-120B, DeepSeek R1 и Kimi K2.5 показал от 1,5 до 1,9 раза больше полезной работы на киловатт, чем стоечные системы Nvidia поколений GB200 и GB300, и задержку ответа ниже в 1,7–3,6 раза. При этом сам он потребляет всего 700 ватт против 1200–1400 ватт у соперника — выигрыш получается не только в скорости, но и в счетах за электричество дата-центра.
Сравнение честным не назвать до конца, и даже сама компания это признает. Jalapeno построен на новой памяти HBM4, а Blackwell — на предыдущем поколении HBM3E, поэтому корректнее было бы сверять его с еще не вышедшей платформой Nvidia Rubin, которая тоже перейдет на HBM4. Инженеры OpenAI объясняют, что главным узким местом современных ускорителей стала не сама память, а пропускная способность до нее — именно на это и рассчитана архитектура с пространственной моделью программирования.
История с Jalapeno вписывается в более широкую картину. Google уже производит седьмое поколение своих тензорных процессоров под кодовым именем Ironwood, Amazon развернула больше миллиона чипов Trainium третьего поколения и получает с заказного «железа» свыше 25 миллиардов долларов выручки в год, а у Meta готово следующее поколение MTIA — пусть пока и без публичного доступа для сторонних клиентов. Аналитики Morgan Stanley допускают, что доля Nvidia на рынке инференса, сегодня превышающая 90%, к 2028 году может сжаться до 20–30%. Сама компания Дженсена Хуанга не сидит сложа руки и готовит платформу Vera Rubin с производительностью 50 петафлопс в формате FP4 и памятью 288 гигабайт.
Мигрировать с ее экосистемы непросто даже тем, у кого есть свои чипы: десятилетия библиотек и инструментов написаны под CUDA — программную платформу для расчетов на видеокартах, и переход на TPU, Trainium или собственные ускорители OpenAI означает переписывать код заново. Именно поэтому речь идет не о полном разводе с Nvidia, а о попытке не зависеть от нее одной.
