Microsoft ha presentado MAI-Transcribe-2-Streaming, su primer modelo propio de transcripción en streaming, acompañado de MAI-Voice-2.1 y una variante Flash orientada a reducir al mínimo la latencia. El objetivo es claro: conseguir que hablar con una inteligencia artificial se parezca cada vez más a mantener una conversación normal.
Por ahora no estamos ante una actualización directa de Copilot para consumidores. Los nuevos modelos están destinados principalmente a desarrolladores, aunque muestran hacia dónde puede evolucionar la voz dentro del ecosistema de Microsoft. Es interesante porque lejos de ir a competir con Claude u OpenAI, Microsoft está buscando sus nichos, sus modelos no tan populares pero muy útiles.
MAI-Transcribe-2-Streaming empieza a entenderte mientras hablas
La principal ventaja de MAI-Transcribe-2-Streaming es que no necesita esperar a que terminemos una frase para empezar a procesarla. Según Microsoft, puede generar sus primeras hipótesis de transcripción poco más de 100 milisegundos después de recibir el audio.
Después va corrigiendo el texto a medida que recibe más contexto. Esto permite que un agente de IA pueda comenzar a interpretar una petición e incluso preparar una respuesta antes de que el usuario haya terminado de hablar.
El modelo funciona en 60 idiomas, incorpora detección automática del idioma y Microsoft afirma que obtiene resultados especialmente competitivos tanto en precisión como en velocidad. La familia MAI-Transcribe incluye además soporte para español.
MAI-Voice 2.1 completa la conversación
Microsoft también ha presentado MAI-Voice-2.1, encargado de transformar en voz las respuestas generadas por la IA. Es compatible con 23 idiomas y permite mantener una misma identidad de voz cuando se cambia de idioma durante una conversación.
Entre los idiomas compatibles se encuentra específicamente el español de España, además del español de México.
Para aplicaciones que necesitan responder todavía más rápido está MAI-Voice-2.1-Flash, una variante optimizada para asistentes, atención al cliente y conversaciones en tiempo real. Microsoft sitúa su latencia de extremo a extremo alrededor de los 150 milisegundos.
El verdadero objetivo es eliminar los silencios incómodos de la IA
La combinación resulta más importante de lo que parece. Un asistente de voz tiene que escuchar, interpretar la petición, generar una respuesta y convertirla nuevamente en audio. Reducir el tiempo empleado en los primeros y últimos pasos permite dedicar más recursos al razonamiento sin hacer que la conversación parezca lenta.
Los modelos ya están disponibles a través de plataformas como Microsoft Foundry y Azure Voice Live, y pueden probarse mediante la demostración Chatter de Microsoft.
Para el usuario final no cambia nada inmediatamente, pero la dirección es evidente: Microsoft está intentando reducir uno de los mayores obstáculos de los asistentes actuales. Si estas tecnologías terminan llegando a Copilot, hablar con una IA podría sentirse mucho más natural y menos parecido a esperar turnos después de cada pregunta.

