aiminute. ← Todas las noticias de IA
Nuevos Modelos AI Minute Newsroom 2026-08-28

El nuevo modelo de transcripción de Google no escribe lo que dijiste, sino lo que quisiste decir, en 85 idiomas

El nuevo modelo de transcripción de Google no escribe lo que dijiste, sino lo que quisiste decir, en 85 idiomas

Google ha lanzado Gemini 3.5 Transcribe, un modelo de voz a texto construido sobre la comprensión de audio de Gemini y disponible en vista previa pública. Detecta automáticamente más de 85 idiomas, sigue a quien cambia de lengua a mitad de frase, separa hasta tres voces y emite marcas de tiempo por palabra. Lo que lo distingue de un dictado corriente es lo que Google llama transcripción inteligente: elimina muletillas, arregla las autocorrecciones del hablante y da formato al texto sobre la marcha, de modo que el resultado se lee como prosa limpia y no como un registro literal del audio. También puede sesgarse hacia un vocabulario propio para términos especializados y llamar a funciones para delegar tareas en plena transcripción. Google declara una tasa de error por palabra del 2,6 % en audio grabado y del 4,0 % en streaming, y del 5,04 % y 5,50 % respectivamente en el índice multilingüe FLEURS, con una latencia alrededor de un 70 % menor que su antecesor Chirp 3. Está disponible a través de la API de Gemini en Google AI Studio y en la Gemini Enterprise Agent Platform, en Rambler de Gboard para Android y en la aplicación Gemini para macOS, con soporte para Chrome anunciado como próximo.

Por qué importaLa transcripción es la fontanería que hay debajo de mucho trabajo corriente: apuntes de clase, dictado médico, subtítulos, actas de reunión, la entrevista que un periodista tiene que pasar a limpio. El soporte de 85 idiomas con cambio de código es la línea que importa fuera del inglés: casi nadie habla un solo idioma de forma limpia en una misma sesión, y hasta ahora los modelos lo llevaban mal. La limpieza, eso sí, es un canje real. Una transcripción que corrige tus frases en silencio se lee mejor y deja de ser un registro fiel de lo dicho, que es justo la propiedad equivocada para una declaración judicial o un expediente disciplinario.
#Audio y Música

✓ Verificado · 4 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

Al modelo de vídeo de Google ya se le puede decir dónde empieza y dónde acaba un plano, y los borradores cuestan un tercio
2026-08-28
Las listas australianas exigen ahora que un humano haya escrito la canción y cantado la voz principal — la norma entra en vigor el viernes
2026-08-27
El modelo anónimo que los desarrolladores llevaban semanas sondeando ya es descargable con licencia MIT — y Z.ai dice que toda la vista previa corrió en chips chinos
2026-08-27
A los nuevos modelos abiertos de IBM no les enseñaron a describir una terminal: los entrenaron usándola
2026-08-27
Las discográficas acaban de entrar en el capital de la empresa de imágenes con IA: Universal, Sony, Warner y EA están en la ronda de 76 millones de Stability
2026-08-26