Microsoft lanzó el 1 de octubre MAI-Transcribe-2-Streaming, su primer modelo de voz a texto en directo. Devuelve un borrador unos 100 milisegundos después de oír el audio y termina 0,13 segundos tras callarte. Artificial Analysis lo sitúa primero en precisión en directo, con un 2,5% de error y 60 idiomas.