Google DeepMind выпустила две новые голосовые модели, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, и сразу заняла первое место в рейтинге качества голосового Искусственного интеллекта Speech-to-Speech Quality Index от компании Artificial Analysis. Нейросети набрали 82,6 балла, больше, чем у GPT-Live-1 от OpenAI. Обе модели уже доступны через Gemini API и приложение AI Studio, понимают больше 97 языков и умеют разговаривать с человеком, одновременно работая с внешними сервисами в фоне: ищеть билеты, читает содержимое экрана, переносит запись к врачу и т.д.
Разница между версиями — в глубине рассуждения. Базовая модель предназначена для быстрых ответов с минимальной задержкой и понимает визуальный контекст, то есть видит то, что показывает камера или экран собеседника. Extended Thinking добавляет многошаговое рассуждение прямо во время разговора: система размышляет вслух и одновременно докладывает о статусе фоновой задачи. Именно эта версия обошла конкурентов на agentic-тесте τ-Voice (проверка на выполнение реальных многошаговых голосовых поручений) с результатом 68,6%, а на банковском варианте того же теста от компании Sierra показала 35,1%.
Цена оказалась очень привлекательной. Минута аудио на входе стоит $0,005, на выходе — $0,018, то есть около $1,38 в час непрерывного разговора. GPT-Live-1 от OpenAI вышла пятью днями раньше и до сих пор не получила официальной цены в API — по оценкам аналитиков, час разговора с ней обходится от $3 и выше. Google назвала цифру первой и сразу опустила ее вдвое ниже той, что называли для конкурента, а заодно предложила рынку понятный ориентир. Голосовой агент для службы поддержки теперь окажется дешевле живого человека.
Впрочем, в слепых прослушиваниях участники всё ещё нередко выбирали более раннюю версию Gemini Live. Новая модель показывает лучшие результаты в бенчмарках и лидирует в рейтингах, но в живом разговоре её преимущество ощущают не все. Причина в том, что тесты обычно измеряют формальные показатели: точность распознавания, скорость ответа, соблюдение инструкций, качество знаний или выполнение задач. Но приятный голосовой диалог складывается и из менее измеримых вещей — естественной интонации, уместных пауз, эмоциональной реакции, способности не перебивать, не звучать слишком шаблонно и правильно понимать настроение собеседника. Иными словами, модель может быть сильнее по метрикам, но при этом казаться человеку холодной, слишком торопливой, неестественно бодрой или просто менее «живой». Для голосового ассистента это важно: если с ним неприятно разговаривать, высокие позиции в таблице лидеров сами по себе не гарантируют, что пользователи выберут именно его.
Базовая версия уже работает внутри Search Live, а Extended Thinking переезжает в Gemini Live, Gmail, Docs и Keep. Параллельно по соглашению стоимостью около $1 млрд в год именно модели Google разгоняют обновленную Siri в iOS 27 — с оговоркой, что функция недоступна в Евросоюзе: местное регулирование ИИ и цифровых рынков не позволило Apple выпустить помощника с фоновой расшифровкой разговоров вовремя. Гугловский Искусственный интеллект оказался внутри Android, Chrome, рабочих приложений Workspace и теперь Siri одновременно — самое широкое распространение одной модели за всю историю отрасли, притом что по чистой способности рассуждать компания по общим рейтингам все еще уступает Anthropic и OpenAI.
Для бизнеса разница ощутима уже сейчас. Контакт-центр, который раньше платил живому оператору за минуту разговора, получает голосового агента, различающего интонацию и одновременно решающего задачу в фоне, по цене в разы ниже человеческого труда.
