Google представила Gemini 3.5 Live Translate — модель почти синхронного перевода речи в реальном времени на 70+ языков

Новая аудиомодель Google выполняет потоковый перевод, сохраняя интонацию и ритм речи и постепенно внедряется в Google Translate, Meet и сторонние платформы

Google объявила о запуске Gemini 3.5 Live Translate — аудиомодели для почти непрерывного перевода речи в потоковом режиме (speech-to-speech). Система автоматически распознаёт более 70 языков и генерирует переведённую речь в реальном времени, сохраняя интонацию, темп и высоту голоса говорящего.

В отличие от классических систем «построчного» перевода, которые ждут окончания фразы, модель обрабатывает речь по мере поступления аудиосигнала и выдаёт перевод с задержкой в несколько секунд. Такой подход позволяет снизить паузы и разрывы в диалоге, хотя система балансирует между минимальной задержкой и качеством перевода, которому требуется контекст.

По данным Google, модель уже способна автоматически работать с многоязычным вводом без ручной настройки языка и демонстрирует устойчивость к шумным и непредсказуемым акустическим условиям. Это позволяет использовать её для синхронного перевода звонков, онлайн-встреч, лекций, трансляций и других сценариев живой коммуникации.

Источник: Google

Технология уже начинает внедряться в экосистему. В Google Translate функция Live Translate будет доступна глобально на Android и iOS при использовании наушников, обеспечивая перевод речи с сохранением голосовых характеристик собеседника. Для Android также вводится «режим прослушивания», при котором перевод подаётся напрямую в динамик телефона, имитируя обычный телефонный разговор.

В корпоративном сегменте Google Meet планирует интеграцию Gemini 3.5 Live Translate для пользователей Google Workspace, начиная с закрытого тестирования для бизнес-клиентов. Более широкое распространение ожидается позже в течение года.

Помимо собственных продуктов, Google продвигает модель через Gemini Live API, позволяя сторонним разработчикам строить приложения для голосового перевода. В числе партнёров — платформы Agora, Fishjam, LiveKit, Pipecat и Vision Agents, которые используют API для построения сервисов синхронного перевода и дубляжа.

Компания также сообщает о тестах с участием партнёров, включая Grab, где технология применяется для голосового общения между водителями и пассажирами в реальном времени в условиях многоязычной среды с миллионами звонков в месяц.

Отдельно Google подчёркивает использование SynthID — встроенного водяного знака в аудиовыходе модели, который позволяет идентифицировать синтетически сгенерированную речь и должен снижать риски подделки аудиоконтента.