aiminute. ← Все новости ИИ
Новые модели AI Minute Newsroom 2026-08-28

Новая модель транскрибации Google записывает не то, что вы сказали, а то, что имели в виду — на 85 языках

Новая модель транскрибации Google записывает не то, что вы сказали, а то, что имели в виду — на 85 языках

Google выпустила Gemini 3.5 Transcribe — модель распознавания речи, построенную на аудиопонимании Gemini и доступную в публичном превью. Она автоматически определяет более 85 языков, следует за говорящим, который меняет язык в середине фразы, различает до трёх голосов и выдаёт таймкоды на уровне слов. От обычной диктовки её отличает то, что Google называет «умной транскрибацией»: модель убирает слова-паразиты, исправляет самоперебивы говорящего и форматирует текст на ходу, поэтому результат читается как чистая проза, а не как дословная запись аудио. Её также можно склонить к пользовательскому словарю для отраслевых терминов, а в ходе транскрибации она умеет вызывать функции, передавая задачи дальше. Google приводит долю ошибок по словам: 2,6 процента на записанном аудио и 4,0 процента в потоковом режиме, а на многоязычном бенчмарке FLEURS — 5,04 и 5,50 процента соответственно, при задержке примерно на 70 процентов ниже, чем у предшественника Chirp 3. Модель доступна через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform, в Rambler для Gboard на Android и в приложении Gemini для macOS; поддержка Chrome заявлена как готовящаяся.

Почему это важноТранскрибация — это водопровод под множеством обычных дел: конспекты лекций, медицинская диктовка, субтитры, протоколы совещаний, интервью, которое журналисту приходится расшифровывать. Поддержка 85 языков с переключением кодов — та самая строка, которая имеет значение за пределами английского: мало кто говорит на одном языке чисто в течение одной беседы, а модели до сих пор справлялись с этим плохо. Но «уборка» — это настоящий размен. Расшифровка, которая молча исправляет ваши фразы, читается легче и перестаёт быть точной записью сказанного, а это ровно то свойство, которое противопоказано протоколу допроса или дисциплинарному разбирательству.
#Аудио и музыка

✓ Проверено · 4 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Видеомодели Google теперь можно указать, где кадр начинается и где заканчивается, — а черновики стоят втрое дешевле
2026-08-28
В австралийских чартах теперь требуется, чтобы песню написал человек и основной вокал исполнил человек — правило вступает в силу в пятницу
2026-08-27
Анонимную модель, которую разработчики неделями прощупывали, выложили под лицензией MIT — и Z.ai утверждает, что весь превью-период она работала на китайских чипах
2026-08-27
Новые открытые модели IBM не учили описывать терминал — их обучали, заставляя им пользоваться
2026-08-27
Звукозаписывающие мейджоры вошли в капитал ИИ-компании по изображениям: Universal, Sony, Warner и EA — все в раунде Stability на 76 миллионов
2026-08-26