Google встраивает архитектуру своей модели Gemini прямо в кремний серверного чипа, который инженеры компании неофициально называют Frozen v2. Речь не о программе, которая запускается на процессоре, а о самой схеме: часть нейросети буквально впаяна в транзисторы.
В отчете за первый квартал 2026 года глава Alphabet Сундар Пичаи признал: облачное подразделение, впервые перешагнувшее отметку в $20 млрд квартальной выручки, растет быстрее, чем компания успевает нарастить «железо». Портфель невыполненных заказов Google Cloud за квартал удвоился до $462 млрд, а в марте компания, по имеющимся данным, была вынуждена отказать Meta в запрошенных ресурсах. Разрыв латают деньгами: месяцем ранее Google согласилась платить SpaceX почти $1 млрд в месяц, чтобы закрыть часть дефицита за счет чужих дата-центров.
Идея «вморозить» модель в кремний принадлежит Джеффу Дину — одному из архитекторов ранней инфраструктуры Google, а ныне главному научному сотруднику DeepMind. Первая версия проекта была радикальнее: она предлагала впаять в чип конкретные веса нейросети (числовые параметры, которые определяют, как модель отвечает на запрос). От нее отказались, потому что чип работал бы только с одной версией Gemini и устаревал бы за считанные месяцы. Frozen v2 устроен тоньше: в кремний вживляют архитектуру модели, то есть общую схему ее устройства, а веса остаются загружаемыми и обновляемыми отдельно.
За счет этого чип избавляется от львиной доли пересылки данных между памятью и вычислительными блоками — того самого узкого места, из-за которого обычным ускорителям нужна дорогая быстрая память и жидкостное охлаждение. По расчетам инженеров, выигрыш составит от шести до десяти раз по числу токенов (единиц текста, которые обрабатывает нейросеть) на ватт мощности, по сравнению с последними TPU, которые Google делает для ИИ-задач. Разворачивать Frozen v2 планируют не раньше 2028 года, да и то не взамен TPU, а рядом. Программируемые процессоры останутся площадкой для обучения новых моделей, а замороженный чип возьмет на себя рутинный поток однотипных запросов. Производить его собираются заметно меньшими партиями, чем TPU. Сама компания пока держит его в статусе пробного запуска.
Похожий трюк в отрасли уже показывал канадский стартап Taalas: в начале года он представил чип HC1, где в кремний впаяны не только архитектура, но и сами веса модели Llama от Meta. Основал компанию Любиша Баджич, бывший архитектор AMD и Nvidia. Плата за смелость такая: чип умеет работать ровно с одной моделью и ничего больше. Зато скорость — до 17 тысяч токенов в секунду на пользователя, тогда как топовые ускорители Nvidia на этом же тесте выдают около 150. Для новой модели Taalas придется производить новый чип с нуля. Frozen v2 в этом смысле осторожнее: он оставляет Google лазейку обновлять веса без похода на фабрику.
Nvidia на этот вызов отвечает ровно противоположной ставкой. Ни в одном ее чипе не заморожена ни одна модель: платформа Rubin, сменившая Blackwell и вышедшая в серийное производство в этом году, остается программируемой и одинаково годится для Gemini, Llama или любой другой сети. Обещанное десятикратное падение стоимости токена компания получает не за счет впайки модели в схему, а за счет совместного проектирования всей стойки целиком — процессоров, сетевых чипов и систем охлаждения как одного механизма. По сути, на столе два разных подхода: Google и Taalas меняют гибкость на скорость ради одной конкретной модели, Nvidia держит гибкость и выжимает эффективность из архитектуры дата-центра.
