GPT-Live-1 llega a la API de OpenAI: voz full-duplex, interrupciones y llamadas telefónicas
OpenAI lanza GPT-Live-1 para desarrolladores por 0,05 dólares/minuto, con voz full-duplex, WebRTC, WebSockets, telefonía y voces personalizables.
OpenAI ha lanzado GPT-Live-1 en su API, llevando a los desarrolladores su modelo de voz diseñado para mantener conversaciones en tiempo real en aplicaciones, agentes empresariales y sistemas telefónicos. La principal diferencia frente a arquitecturas de voz tradicionales es su funcionamiento full-duplex: el modelo puede escuchar y hablar simultáneamente en lugar de alternar rígidamente entre un turno del usuario y otro del asistente.
GPT-Live-1 está disponible desde el 10 de septiembre de 2026 y cuesta 0,05 dólares por minuto por la capa de voz frontal. El modelo de razonamiento utilizado en segundo plano, las herramientas y otros servicios empleados por el agente se facturan de forma independiente.
GPT-Live-1 puede escuchar mientras está hablando
Los asistentes de voz convencionales suelen combinar tres componentes separados: reconocimiento de voz, un modelo de lenguaje y síntesis de voz. Cada etapa introduce latencia y obliga al sistema a coordinar qué ocurre cuando una persona hace una pausa, interrumpe una respuesta o cambia de idea a mitad de una frase.
GPT-Live-1 procesa conjuntamente el audio entrante y el audio que está generando. Esto permite mantener una conversación donde el usuario puede comenzar a hablar mientras el asistente responde, introducir una corrección o realizar una interrupción sin esperar a que termine completamente la intervención de la IA.
OpenAI denomina a esta arquitectura full-duplex. No significa simplemente que el audio sea rápido, sino que ambos lados de la conversación pueden permanecer activos simultáneamente.
Las interrupciones son una de sus principales diferencias
GPT-Live-1 está especialmente diseñado para interpretar interrupciones, pausas, pequeñas confirmaciones y cambios naturales durante una conversación. El modelo puede diferenciar mejor entre una persona que está pensando, alguien que simplemente dice una breve confirmación y un usuario que realmente quiere interrumpir la respuesta.
OpenAI afirma que el modelo mejora en 30 puntos porcentuales el resultado de Full Duplex Bench frente a GPT-Realtime-2.1, con avances especialmente importantes en latencia de turnos y comportamiento interactivo.
En las primeras evaluaciones realizadas por la aplicación de idiomas Speak, GPT-Live-1 redujo casi un 80% las interrupciones realizadas mientras los estudiantes estaban haciendo pausas para pensar frente a sistemas anteriores basados en turnos.
El modelo de voz puede delegar el razonamiento a otra IA
GPT-Live-1 no está diseñado necesariamente para resolver por sí solo todas las tareas complejas del agente. OpenAI separa la conversación de voz de la capa que realiza el razonamiento profundo y ejecuta herramientas.
Un desarrollador puede utilizar GPT-Live-1 para mantener la conversación y conectarlo en segundo plano con un modelo como GPT-6 Astra para resolver una tarea compleja. También puede utilizar otros modelos de OpenAI o incluso un sistema externo.
Mientras el modelo de backend trabaja, GPT-Live-1 puede continuar gestionando la interacción con el usuario. Esta arquitectura permite, por ejemplo, que un agente telefónico siga conversando mientras consulta una reserva, busca información o ejecuta una acción en otro sistema.
WebRTC para aplicaciones y WebSockets para servidores
OpenAI permite integrar la experiencia de voz en diferentes arquitecturas. Las aplicaciones que necesitan comunicación de audio directa y de baja latencia pueden utilizar WebRTC, una opción especialmente adecuada para navegadores y clientes interactivos.
También se admiten conexiones mediante WebSockets para integraciones donde la aplicación mantiene la sesión desde infraestructura de servidor.
La elección permite que GPT-Live-1 pueda utilizarse tanto en una interfaz de voz dentro de una página web como en aplicaciones empresariales que necesitan controlar las sesiones, herramientas y lógica desde su propio backend.
GPT-Live-1 también puede atender llamadas telefónicas
La API incorpora soporte específico para telefonía mediante SIP. Esto permite conectar GPT-Live-1 con llamadas telefónicas entrantes y utilizarlo como la capa conversacional de un agente de voz.
OpenAI plantea casos de uso como reservas en restaurantes, gestión de pedidos y atención al cliente. La documentación de la API permite aceptar una llamada SIP directamente en una sesión de GPT-Live-1.
La API también contempla la posibilidad de transferir una llamada en curso hacia otro destino, incluido un número telefónico o un agente mediante SIP. Esto permite diseñar sistemas donde la IA atiende inicialmente al usuario y deriva posteriormente la llamada a una persona.
El tono, el ritmo y el estilo se pueden controlar mediante instrucciones
Los desarrolladores pueden definir mediante el prompt del sistema cómo debe expresarse su agente. GPT-Live-1 admite instrucciones relacionadas con el tono, el ritmo y el estilo de conversación.
Esto permite configurar experiencias diferentes dependiendo del producto. Un agente de soporte puede utilizar respuestas breves y profesionales, mientras que un tutor de idiomas puede hablar de forma más pausada y dejar más tiempo para que el estudiante responda.
OpenAI también ha ampliado el catálogo de voces disponibles en tiempo real con opciones como Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta y Cinder, junto con una mayor variedad de acentos, dialectos e idiomas.
OpenAI también ofrece acceso a voces personalizadas
Además del catálogo de voces predefinidas, OpenAI contempla el uso de voces personalizadas con GPT-Live-1. Sin embargo, este acceso no está abierto automáticamente a cualquier proyecto de API.
La compañía indica que las organizaciones interesadas deben contactar con su equipo comercial para conocer los requisitos de elegibilidad y el proceso de solicitud.
Por tanto, la personalización disponible de forma general incluye el control del tono, ritmo y estilo mediante instrucciones, mientras que la creación o utilización de una voz personalizada está sujeta a un proceso adicional de acceso.
Incluye transcripciones y detección de turnos
Aunque su arquitectura no depende de una conversación estrictamente basada en turnos, GPT-Live-1 puede detectar cuándo comienza y termina una intervención del usuario.
El modelo genera además transcripciones ASR del audio recibido y texto correspondiente a sus propias respuestas. También incorpora reconocimiento mejorado de secuencias alfanuméricas y keyword biasing, que permite favorecer términos importantes para una aplicación concreta.
Estas funciones resultan especialmente relevantes en llamadas donde deben reconocerse correctamente nombres, códigos, identificadores, números de pedido o terminología especializada.
GPT-Live-1 cuesta 0,05 dólares por minuto
OpenAI ha establecido un modelo de precio diferente al habitual cálculo por tokens de sus modelos de texto. La capa frontal de GPT-Live-1 cuesta 0,05 dólares por minuto de conversación de voz, con facturación por segundo.
Ese precio no incluye necesariamente todo el agente. Si GPT-Live-1 delega una consulta a GPT-6 Astra, otro modelo de texto o una herramienta externa, esos recursos generan sus propios costes.
La estructura permite elegir diferentes modelos de backend según la tarea. Una empresa puede utilizar un modelo más económico para operaciones rutinarias y recurrir a un modelo de mayor capacidad únicamente cuando una conversación requiere razonamiento avanzado.
GPT-Live-1 ya está disponible en la API
GPT-Live-1 no se encuentra en una fase de anuncio previo. OpenAI confirma que el modelo está disponible actualmente para desarrolladores mediante su API.
La llegada a la API es distinta de los cambios realizados anteriormente en ChatGPT Voice. En este caso, el producto está dirigido a desarrolladores que quieran incorporar la tecnología de voz de OpenAI dentro de sus propias aplicaciones, centros de atención, asistentes y agentes telefónicos.
Con WebRTC, WebSockets y soporte de telefonía SIP, OpenAI busca que la misma capa conversacional pueda utilizarse desde una aplicación web hasta un número telefónico, manteniendo las interrupciones y la conversación simultánea que caracterizan a GPT-Live-1.