Microsoft AI ha presentado su primer modelo de transcripción en tiempo real, que pasa a texto lo que se dice en 60 idiomas mientras se habla, y dos nuevos modelos de voz que hablan 23 idiomas y clonan una voz con unos segundos de audio. Lo anunció el 1 de octubre en su web, y el objetivo está claro: agentes de voz que escuchen, entiendan y respondan sin que la charla deje de parecer una conversación.
Transcribe mientras hablas
El protagonista es MAI-Transcribe-2-Streaming, que transcribe en tiempo real en 60 idiomas y detecta de forma automática y continua cuál se está hablando. Y no espera a que la persona termine para devolver el texto.
Según Microsoft, ofrece sus primeras hipótesis, lo que llama «parciales», en poco más de 100 milisegundos desde que recibe el audio, las corrige conforme llega más contexto y fija enseguida una transcripción estable. Eso permite a las aplicaciones de voz actuar antes de que la persona acabe de hablar. En dictado o subtitulado en tiempo real, sus evaluaciones internas indican que las palabras salen el doble de rápido que con su competidor más cercano.
En precisión, la compañía asegura que es el número 1 de Artificial Analysis tanto en transcripciones finales como parciales, y que en su evaluación de precisión frente a latencia se sitúa en la frontera de Pareto, lo que a su juicio demuestra que «una mayor precisión no tiene por qué venir acompañada de un gran sacrificio en latencia».
Una sola voz en 23 idiomas, con acento nativo
El segundo anuncio es MAI-Voice-2.1, que Microsoft describe como su modelo de texto a voz multilingüe más potente hasta ahora. Habla 23 idiomas y 26 variantes regionales, y una misma voz puede usarlos todos con acento nativo. El ejemplo de la empresa: se le pide inglés, luego mandarín y luego alemán, y el hablante sigue siendo inconfundiblemente el mismo, con la forma de hablar de cada lugar en vez de arrastrar un único acento.
Así, una marca puede mantener una única voz en todas partes, una aplicación de tutorías puede cambiar de idioma a mitad de clase sin cambiar de profesor y un asistente multilingüe puede contestar en el idioma en que se le hable, sin dejar de sonar igual.
Flash para ir rápido y clonación con consentimiento
Le acompaña MAI-Voice-2.1-Flash, con los mismos idiomas y voces políglotas, pero pensado para grandes volúmenes y tareas en las que el retraso es crítico. Puede generar 45 segundos de audio con un retraso total, de extremo a extremo, de apenas 150 milisegundos, menos de una quinta parte de segundo. Por esa combinación de latencia, calidad y eficiencia en costes, Microsoft lo presenta como el compañero natural de su modelo de transcripción.
Los dos modelos de voz pueden clonar voces en todos los idiomas compatibles a partir de solo unos segundos de audio de referencia, algo que, explica la compañía, facilita a sus clientes usar la voz de su marca. A la vez, Microsoft afirma que llevan integradas «salvaguardas de consentimiento que impiden el mal uso», aunque la entrada no detalla cómo funcionan.
Para qué lo quiere Microsoft y dónde está
La compañía lo resume así: un agente de voz es un bucle que tiene que oír, entender, decidir y hablar dentro del margen en el que una persona sigue sintiendo que conversa. Juntar la transcripción con Flash ahorra tiempo en ambos extremos, que el agente puede dedicar a razonar, usar herramientas y comprobar su respuesta.
Pone como ejemplos agentes de atención al cliente que transcriben la petición mientras se formula, empiezan a actuar antes de que quien llama termine y responden con voz natural; asistentes multilingües que detectan el idioma y contestan en cualquiera de los 23 con la misma voz; y contenidos interactivos y de aprendizaje con distintos hablantes para tutorías, juegos de rol, simulaciones o narración.
Los tres modelos llegan a través de Microsoft Foundry, y para mostrarlos trabajando juntos Microsoft ha creado Chatter, una nueva demostración con un agente en directo dentro de MAI Playground. La compañía indica que MAI-Transcribe-2-Streaming sale con un precio de lanzamiento de 0,54 dólares por hora de audio hasta final de año.
Te puede interesar
Tech Planet participa en el programa de afiliados de Amazon. Si compras a través de estos enlaces, recibimos una pequeña comisión sin coste extra para ti, lo que nos ayuda a seguir creando contenido como este.
| Imagen | Producto | Características | Comprar |
|---|---|---|---|
![]() |
Creative Pebble V3 | Altavoces 2.0 con USB-C · drivers de 2,25″ · Bluetooth 5.0 y Clear Dialog | Ver precio en Amazon |
![]() |
Edifier R1280DB | 2 × 21 W RMS · Bluetooth, óptico, coaxial y RCA · mando a distancia | Ver precio en Amazon |
![]() |
Creative Sound Blaster G6 | DAC y tarjeta de sonido USB externa · 7.1 virtual y Dolby Digital · amplificador de auriculares | Ver precio en Amazon |
![]() |
JBL Flip 7 | Altavoz Bluetooth portátil · IP68 · resiste caídas de 1 m | Ver precio en Amazon |
Escrito por Eloy Andrade









