Herramientas
OpenAI lanza GPT-Live-1 en su API: una voz que escucha y habla a la vez
OpenAI presentó el 10 de septiembre de 2026 GPT-Live-1, una capa de voz para su API que escucha y habla al mismo tiempo. Es un solo modelo de audio y se encarga de las interrupciones, los silencios y el ruido de fondo. El precio anunciado es de 0,05 dólares por minuto por la capa de voz; el backend se paga aparte.
Recibe el resumen diario de IA
Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.
Al suscribirte aceptas recibir el newsletter de AI Informator. Puedes darte de baja cuando quieras.
En resumen
- GPT-Live-1 ya funciona en la API de OpenAI como capa de voz full-duplex (dúplex completo: escuchar y hablar a la vez).
- Un único modelo de audio resuelve las interrupciones, sin encadenar componentes separados.
- Puede pasarle el razonamiento y el uso de herramientas a un modelo de texto.
- Deja controlar el tono, el ritmo y el estilo de la voz, y se maneja con silencios y ruido de fondo.
- Incluye transcripción ASR, detección de turnos y telefonía.
- OpenAI afirma una mejora de +30 puntos en Full Duplex Bench frente a GPT-Realtime-2.1.
- Speak dice haber medido casi un 80% menos de interrupciones que con sistemas por turnos.
- Precio oficial: 0,05 dólares por minuto por la capa de voz; el backend se factura por separado.
- Fecha oficial del anuncio: 10 de septiembre de 2026.
Qué es GPT-Live-1
OpenAI define GPT-Live-1 como una capa de voz para su API que trabaja en full-duplex: escucha y habla a la vez, sin esperar a que el interlocutor termine para empezar a responder. Ahí está la diferencia con los sistemas conversacionales que funcionan por turnos.
La compañía insiste en un punto: las interrupciones las gestiona un único modelo de audio. No hay varias piezas coordinándose para detectar que alguien corta la frase; el mismo modelo que genera el sonido resuelve la situación.
La página oficial añade que GPT-Live-1 también se maneja con los silencios y el ruido, justo donde suelen fallar los sistemas por turnos: una pausa se confunde con el final de la intervención y el ruido ambiental, con alguien que empieza a hablar.
Cómo se reparte el trabajo con un modelo de texto
OpenAI subraya que GPT-Live-1 puede pasarle el razonamiento y el uso de herramientas a un modelo de texto. La capa de voz se queda con la conversación hablada; lo que exige pensar más o acceder a funciones externas viaja a otro componente.
Ese reparto explica cómo está montado el precio: los 0,05 dólares por minuto pagan la capa de voz, y el backend se factura por separado. Quien construya sobre GPT-Live-1 tiene, por tanto, dos facturas que calcular, no una.
Control de la voz y funciones que vienen incluidas
Según la página oficial, el desarrollador puede controlar el tono, el ritmo y el estilo de la voz generada. Importa para quien diseña asistentes con una identidad sonora propia o necesita cambiar la cadencia según el contexto.
El paquete incorpora además transcripción ASR, detección de turnos y telefonía. Son las tres piezas que hacen falta para poner un asistente de voz en producción: convertir el audio en texto, saber a quién le toca hablar y conectar el sistema con la red telefónica.
Qué dicen las cifras y quién las firma
OpenAI afirma una mejora de +30 puntos en Full Duplex Bench frente a GPT-Realtime-2.1. El dato sale del anuncio de la propia compañía; nadie ajeno lo ha medido.
Speak, por su parte, dice haber observado casi un 80% menos de interrupciones que con sistemas por turnos. Conviene señalar también de dónde sale: son pruebas internas de la empresa que usa la tecnología, recogidas en el material de lanzamiento.
Las dos cifras apuntan a lo mismo, una conversación con menos cortes, pero las firma quien tiene interés en el resultado. Mientras no haya evaluaciones externas que cualquiera pueda repetir, lo sensato es leerlas como lo que son: datos declarados por quien lanza la tecnología y por quien ya la usa.
Conclusión
GPT-Live-1 lleva a la API de OpenAI una conversación que no espera turnos: escucha mientras habla, corta y se deja cortar. La propuesta técnica es nítida —un solo modelo de audio para las interrupciones, el razonamiento delegado a un modelo de texto y un paquete con ASR, detección de turnos y telefonía— y el precio de la capa de voz ya está publicado: 0,05 dólares por minuto, con el backend aparte. Las mejoras cuantificadas, en cambio, siguen siendo palabra de OpenAI y de Speak. La distancia entre lo anunciado y lo comprobable la irán midiendo los desarrolladores, que ya pueden probarlo.
Fuentes primarias
Recibe el resumen diario de IA
Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.
Al suscribirte aceptas recibir el newsletter de AI Informator. Puedes darte de baja cuando quieras.
Comentarios