Новые модели
AI Minute Newsroom
2026-08-28
Новая модель транскрибации Google записывает не то, что вы сказали, а то, что имели в виду — на 85 языках
Google выпустила Gemini 3.5 Transcribe — модель распознавания речи, построенную на аудиопонимании Gemini и доступную в публичном превью. Она автоматически определяет более 85 языков, следует за говорящим, который меняет язык в середине фразы, различает до трёх голосов и выдаёт таймкоды на уровне слов. От обычной диктовки её отличает то, что Google называет «умной транскрибацией»: модель убирает слова-паразиты, исправляет самоперебивы говорящего и форматирует текст на ходу, поэтому результат читается как чистая проза, а не как дословная запись аудио. Её также можно склонить к пользовательскому словарю для отраслевых терминов, а в ходе транскрибации она умеет вызывать функции, передавая задачи дальше. Google приводит долю ошибок по словам: 2,6 процента на записанном аудио и 4,0 процента в потоковом режиме, а на многоязычном бенчмарке FLEURS — 5,04 и 5,50 процента соответственно, при задержке примерно на 70 процентов ниже, чем у предшественника Chirp 3. Модель доступна через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform, в Rambler для Gboard на Android и в приложении Gemini для macOS; поддержка Chrome заявлена как готовящаяся.
Почему это важноТранскрибация — это водопровод под множеством обычных дел: конспекты лекций, медицинская диктовка, субтитры, протоколы совещаний, интервью, которое журналисту приходится расшифровывать. Поддержка 85 языков с переключением кодов — та самая строка, которая имеет значение за пределами английского: мало кто говорит на одном языке чисто в течение одной беседы, а модели до сих пор справлялись с этим плохо. Но «уборка» — это настоящий размен. Расшифровка, которая молча исправляет ваши фразы, читается легче и перестаёт быть точной записью сказанного, а это ровно то свойство, которое противопоказано протоколу допроса или дисциплинарному разбирательству.
✓ Проверено · 4 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Видеомодели Google теперь можно указать, где кадр начинается и где заканчивается, — а черновики стоят втрое дешевле
2026-08-28В австралийских чартах теперь требуется, чтобы песню написал человек и основной вокал исполнил человек — правило вступает в силу в пятницу
2026-08-27Анонимную модель, которую разработчики неделями прощупывали, выложили под лицензией MIT — и Z.ai утверждает, что весь превью-период она работала на китайских чипах
2026-08-27Новые открытые модели IBM не учили описывать терминал — их обучали, заставляя им пользоваться
2026-08-27Звукозаписывающие мейджоры вошли в капитал ИИ-компании по изображениям: Universal, Sony, Warner и EA — все в раунде Stability на 76 миллионов
2026-08-26