Microsoft ha presentado tres modelos de audio diseñados para que los agentes de inteligencia artificial escuchen, razonen y respondan con menos demora durante una conversación: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 y MAI-Voice-2.1-Flash. La compañía destaca la velocidad de respuesta y el soporte multilingüe de la propuesta, aunque reconoce que su servicio de transcripción sigue en vista previa pública, sin acuerdo de nivel de servicio, y no está recomendado para cargas de trabajo de producción.
El anuncio, firmado por Microsoft AI, combina MAI-Transcribe-2-Streaming, que convierte el habla en texto mientras la persona sigue hablando, con MAI-Voice-2.1 y su variante MAI-Voice-2.1-Flash, orientadas a generar respuestas habladas. El objetivo es acortar el tiempo que transcurre entre la intervención de un usuario y la reacción del sistema, aunque las cifras de rendimiento proceden de pruebas internas de la propia empresa y conviene leerlas con ese matiz.
Un mismo ciclo conversacional: escuchar, razonar y hablar
Microsoft presenta este conjunto como las piezas de un mismo flujo: escuchar, razonar, usar herramientas y hablar dentro de una conversación natural. MAI-Transcribe-2-Streaming se ocupa de la escucha; MAI-Voice-2.1 y su variante Flash, de la respuesta hablada. La compañía también ha lanzado Chatter, una demostración disponible en MAI Playground que muestra los tres modelos funcionando en conjunto.
Para quien desarrolla un asistente conversacional, el valor de esta integración dependerá de cómo se comporten juntas la latencia de transcripción, la generación de voz y las necesidades concretas de cada aplicación, más allá de las cifras que la compañía anuncia por separado para cada modelo.
MAI-Transcribe-2 transcribe mientras el usuario habla
El modelo recibe audio continuo y devuelve resultados incrementales: primero propone un texto provisional y después lo actualiza a medida que incorpora más contexto, hasta confirmar cada segmento como estable. Esa secuencia permite que un agente empiece a razonar o a llamar herramientas antes de que la persona termine de hablar, y también que los subtítulos en vivo aparezcan durante el discurso en lugar de esperar al cierre de una frase completa.
Microsoft asegura que sus pruebas internas mostraron que las palabras aparecen el doble de rápido que con el competidor más cercano en dictado y subtitulado en tiempo real, aunque esa comparación es una afirmación de la propia empresa y no una medición independiente detallada en la documentación disponible. Según esas mismas cifras, el sistema empieza a producir hipótesis parciales poco más de 100 milisegundos después de recibir el audio, las revisa conforme sigue escuchando y confirma con rapidez el texto que considera estable.
El modelo admite 60 idiomas y los detecta de forma automática y continua, sin que el usuario tenga que detenerse para configurar manualmente cada intervención. Esa capacidad puede resultar útil en conversaciones donde el idioma cambia sobre la marcha, una situación habitual en entornos multilingües.
Precio y voces de MAI-Voice-2.1 y su versión Flash
MAI-Voice-2.1 sintetiza voz en 23 idiomas y 26 configuraciones regionales, con un precio de 22 dólares por millón de caracteres. La variante MAI-Voice-2.1-Flash, pensada para tareas de alto volumen y sensibles a la latencia, cuesta 15 dólares por millón de caracteres.
Microsoft sostiene que Flash puede generar 45 segundos de audio con una latencia de extremo a extremo de 150 milisegundos, con una inferencia un 55% más rápida y un coste alrededor de un 60% inferior al de modelos comparables. La compañía señala además que una misma identidad de voz puede cambiar de idioma sin perder su timbre reconocible, adoptando lo que describe como un acento nativo y expresiones locales: así, un asistente podría responder en el idioma que escucha sin cambiar de voz.
Ambos modelos admiten clonación a partir de unos pocos segundos de audio de referencia, entre los idiomas compatibles, con salvaguardas de consentimiento que Microsoft dice haber incorporado para prevenir usos indebidos; el anuncio no detalla cómo funcionan esas medidas ni qué límites tienen, por lo que no procede asumir que eliminan por completo los riesgos de replicar una voz sin autorización.
Cifras de rendimiento propias y límites
Tanto la velocidad de transcripción como las ventajas de Flash frente a «modelos comparables» son cifras que la compañía atribuye a sus propias pruebas internas. Sirven como referencia del salto que Microsoft quiere destacar, pero no equivalen a una medición independiente ni garantizan resultados idénticos en cualquier aplicación. El rendimiento real que note cada desarrollador dependerá de cómo interactúen la latencia de transcripción, el razonamiento del modelo que procesa la conversación y la generación de voz final, variables que cambian según el caso de uso y la infraestructura sobre la que se despliegue el agente.
La documentación de Microsoft clasifica MAI-Transcribe-2-Streaming como vista previa pública: no cuenta con acuerdo de nivel de servicio y no se recomienda para cargas de trabajo de producción. El precio introductorio de la transcripción es de 0,54 dólares por hora de audio hasta final de año, una cifra atractiva que no debe confundirse con una madurez operativa del servicio. Mientras no haya un anuncio de disponibilidad general, los equipos que evalúen esta tecnología tendrán que probarla en entornos de desarrollo antes de apoyar en ella procesos sensibles.
Dónde se pueden probar los modelos de IA de voz
Los dos modelos de voz están disponibles a través de OpenRouter, y los tres modelos pueden utilizarse mediante Microsoft Foundry, MAI Playground, Vercel y Azure Voice Live, con soporte de Live anunciado como próximo paso. La integración de la transcripción contempla una API en tiempo real compatible con OpenAI Realtime sobre WebSocket o con el Azure Speech SDK.
Conviene no confundir esta herramienta para desarrolladores con las funciones de transcripción que ya ofrecen Word o Teams al usuario final: los nuevos modelos son piezas de software pensadas para construir agentes conversacionales personalizados, mientras que las aplicaciones de ofimática entregan la transcripción en vivo como una funcionalidad cerrada. El anuncio tampoco detalla cómo se tratarán los datos de voz capturados ni cómo se ajustará la clonación a la normativa de privacidad vigente en la Unión Europea, un punto que previsiblemente se irá aclarando a medida que el servicio avance hacia la disponibilidad general.
