Google выпустила новую модель для преобразования речи в текст под названием Gemini 3.5 Transcribe. Она предназначена не только для точной транскрипции слов, но и для понимания того, что человек хотел сказать: система ориентируется на естественный стиль речи, улавливает исправления по ходу фразы и формирует уже аккуратно оформленный текст.

Модель работает как с заранее записанными файлами, так и в режиме реального времени с задержкой менее одной секунды. По данным Google, она умеет разделять речь нескольких участников разговора, ставить временные метки к словам и переключаться между языками прямо во время диалога. Отдельное внимание уделено очистке от оговорок и слов-паразитов: «э-э», паузы и самокоррекция автоматически фильтруются без ручного редактирования текста.

Сравнение возможностей Gemini 3.5 Transcribe для живого потока и записанных файлов

Потоковый и файловый режимы Gemini 3.5 Transcribe поддерживают разные расширенные функции.

На многоязычном тесте FLEURS компания заявляет ошибку распознавания около 5%, а независимые измерения Artificial Analysis показывают сокращение времени до окончательной транскрипции примерно на 70% по сравнению с предыдущим решением Chirp 3. При этом подчёркивается, что эти показатели получены в тестовых условиях; качество работы модели на шумной кухне, производстве или совещании с плохими микрофонами может заметно отличаться.

Ошибка распознавания Gemini 3.5 Transcribe на FLEURS и сокращение задержки относительно Chirp 3

Google приводит WER 5,50% для потока и 5,04% для файлов на FLEURS; время до финального текста сократилось на 70%.

Gemini 3.5 Transcribe доступна разработчикам через Gemini API в Google AI Studio и платформу Enterprise Agent Platform, а также используется внутри продуктов Google — например, в приложении Gemini для macOS (на английском) и функции Rambler на Gboard для Android. Компания позиционирует её как основу для голосовых агентов и других интерфейсов, где важно понимать не только дословный текст, но и смысл сказанного.

Источник