Modelos de IA

Meta lanza Muse Voice Transcribe: transcripción en tiempo real por 0,18 dólares la hora

Muse Voice Transcribe combina transcripción, diarización para más de 20 hablantes y detección de turnos por 3 dólares cada 1.000 minutos.

Meta ha lanzado Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real desarrollado por Meta Superintelligence Labs. La compañía lo ofrece mediante su Model API por 3 dólares cada 1.000 minutos de audio procesado, equivalentes a 0,18 dólares por hora, con transcripción, identificación de hablantes y detección del final de cada turno integradas en el mismo modelo.

El lanzamiento sitúa a Meta en un mercado donde compiten servicios especializados de transcripción y modelos de inteligencia artificial de compañías como Speechmatics, Deepgram, AssemblyAI, xAI, Google, Amazon y OpenAI. Su principal argumento es combinar varias funciones de procesamiento de voz con un precio relativamente bajo para aplicaciones que necesitan trabajar con conversaciones mientras están ocurriendo.

Muse Voice Transcribe identifica a más de 20 hablantes

Además del reconocimiento automático del habla, Muse Voice Transcribe incorpora diarización, la tecnología utilizada para determinar qué participante está hablando en cada momento. Meta asegura que el modelo puede trabajar con conversaciones de más de una hora y con más de 20 hablantes sin necesitar una fase separada de procesamiento posterior.

La cifra de más de 20 participantes no constituye, sin embargo, un récord del sector. Speechmatics documenta hasta 50 hablantes de forma predeterminada y permite configurar hasta 100, mientras que Amazon Transcribe admite un máximo de 30. La demostración principal publicada por Meta utiliza ocho personas y su ejemplo de larga duración contiene 11 participantes identificados, por lo que la capacidad de más de 20 hablantes es una especificación declarada por Meta y no el número mostrado en esas demostraciones públicas.

Transcripción, diarización y detección de turnos en un solo modelo

Muse procesa el audio en fragmentos de 80 milisegundos y utiliza un mecanismo denominado adaptive delay. En lugar de aplicar el mismo retraso a todas las palabras, el modelo puede esperar más contexto cuando encuentra una parte difícil de interpretar y generar antes el texto cuando dispone de suficiente información.

Meta también ha entrenado conjuntamente la transcripción, la diarización y el endpointing. Esta última función permite detectar cuándo comienza y cuándo termina una intervención, un elemento especialmente útil para asistentes de voz y agentes de IA que necesitan decidir cuándo pueden responder sin interrumpir al usuario.

El modelo fue entrenado con más de 70 idiomas. Meta afirma haber validado de forma más exhaustiva 25 de ellos para el lanzamiento inicial. También admite cambios de idioma dentro de una misma conversación y permite introducir información contextual, nombres o palabras clave para mejorar el reconocimiento de términos específicos.

Meta cobra 0,18 dólares por cada hora de audio

La tarifa pública es uno de los aspectos más competitivos del lanzamiento. Muse Voice Transcribe cuesta 3 dólares por 1.000 minutos, es decir, 0,003 dólares por minuto o 0,18 dólares por una hora completa de audio procesado. A esa tarifa, procesar 1.000 horas supondría aproximadamente 180 dólares.

Según la documentación revisada por VentureBeat, Meta aplica el mismo precio tanto a la transcripción en streaming como al procesamiento no interactivo y no cobra un suplemento por la diarización. La compañía también ofrece una modalidad de retención cero de datos con la misma tarifa.

El precio no convierte a Muse en el servicio de streaming más barato en términos absolutos. VentureBeat sitúa, por ejemplo, a Soniox en unos 0,12 dólares por hora con diarización para hasta 15 hablantes. Sin embargo, Muse queda en la parte baja del mercado cuando se compara con servicios que incluyen identificación de hablantes: xAI ronda los 0,20 dólares por hora, Speechmatics los 0,24 dólares y otras alternativas pueden superar los 0,40 dólares cuando se añaden funciones de diarización. Estas comparaciones pueden variar según planes, regiones y condiciones comerciales.

Meta también apuesta por la precisión en tiempo real

Meta señala que Muse Voice Transcribe ocupaba el primer puesto de la evaluación de transcripción en streaming de Artificial Analysis en el momento de su lanzamiento, el 1 de septiembre de 2026. En los datos presentados por la compañía, el modelo obtuvo una tasa de error de palabras del 3,1% en la transcripción final.

Como ocurre con cualquier benchmark de reconocimiento de voz, esos resultados no garantizan el mismo rendimiento en todas las condiciones. Micrófonos de baja calidad, ruido, acentos, conversaciones simultáneas y vocabulario especializado pueden modificar considerablemente la precisión obtenida en una implementación real.

Muse ya está integrado en productos de Meta

Muse Voice Transcribe ya se utiliza para el dictado en la aplicación de escritorio de Meta AI y para la entrada de voz en Muse Code. Los desarrolladores también pueden acceder al modelo mediante la Model API de Meta para construir herramientas de reuniones, subtítulos en directo, análisis de llamadas, sistemas de dictado y asistentes de voz.

La combinación de transcripción en streaming, identificación de numerosos participantes y un coste de 0,18 dólares por hora puede resultar especialmente relevante para servicios empresariales que procesan grandes cantidades de audio. El lanzamiento también aumenta la presión competitiva sobre proveedores que hasta ahora comercializaban por separado el reconocimiento del habla y funciones adicionales como la diarización.