Nuevos Modelos
AI Minute Newsroom
2026-08-28
El nuevo modelo de transcripción de Google no escribe lo que dijiste, sino lo que quisiste decir, en 85 idiomas
Google ha lanzado Gemini 3.5 Transcribe, un modelo de voz a texto construido sobre la comprensión de audio de Gemini y disponible en vista previa pública. Detecta automáticamente más de 85 idiomas, sigue a quien cambia de lengua a mitad de frase, separa hasta tres voces y emite marcas de tiempo por palabra. Lo que lo distingue de un dictado corriente es lo que Google llama transcripción inteligente: elimina muletillas, arregla las autocorrecciones del hablante y da formato al texto sobre la marcha, de modo que el resultado se lee como prosa limpia y no como un registro literal del audio. También puede sesgarse hacia un vocabulario propio para términos especializados y llamar a funciones para delegar tareas en plena transcripción. Google declara una tasa de error por palabra del 2,6 % en audio grabado y del 4,0 % en streaming, y del 5,04 % y 5,50 % respectivamente en el índice multilingüe FLEURS, con una latencia alrededor de un 70 % menor que su antecesor Chirp 3. Está disponible a través de la API de Gemini en Google AI Studio y en la Gemini Enterprise Agent Platform, en Rambler de Gboard para Android y en la aplicación Gemini para macOS, con soporte para Chrome anunciado como próximo.
Por qué importaLa transcripción es la fontanería que hay debajo de mucho trabajo corriente: apuntes de clase, dictado médico, subtítulos, actas de reunión, la entrevista que un periodista tiene que pasar a limpio. El soporte de 85 idiomas con cambio de código es la línea que importa fuera del inglés: casi nadie habla un solo idioma de forma limpia en una misma sesión, y hasta ahora los modelos lo llevaban mal. La limpieza, eso sí, es un canje real. Una transcripción que corrige tus frases en silencio se lee mejor y deja de ser un registro fiel de lo dicho, que es justo la propiedad equivocada para una declaración judicial o un expediente disciplinario.
✓ Verificado · 4 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Al modelo de vídeo de Google ya se le puede decir dónde empieza y dónde acaba un plano, y los borradores cuestan un tercio
2026-08-28Las listas australianas exigen ahora que un humano haya escrito la canción y cantado la voz principal — la norma entra en vigor el viernes
2026-08-27El modelo anónimo que los desarrolladores llevaban semanas sondeando ya es descargable con licencia MIT — y Z.ai dice que toda la vista previa corrió en chips chinos
2026-08-27A los nuevos modelos abiertos de IBM no les enseñaron a describir una terminal: los entrenaron usándola
2026-08-27Las discográficas acaban de entrar en el capital de la empresa de imágenes con IA: Universal, Sony, Warner y EA están en la ronda de 76 millones de Stability
2026-08-26