Eines
OpenAI estrena GPT-Live-1 a l'API: una veu que escolta i parla alhora
El 10 de setembre del 2026 OpenAI va presentar GPT-Live-1, una capa de veu per a la seva API que escolta i parla al mateix temps. És un sol model d'àudio i se'n surt tot sol amb les interrupcions, els silencis i el soroll de fons. El preu anunciat és de 0,05 dòlars per minut per la capa de veu; el backend es paga a part.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- GPT-Live-1 ja funciona a l'API d'OpenAI com a capa de veu full-duplex (dúplex complet: escoltar i parlar alhora).
- Un únic model d'àudio resol les interrupcions, sense encadenar components separats.
- Pot delegar el raonament i l'ús d'eines a un model de text.
- Permet controlar el to, el ritme i l'estil de la veu, i se'n surt amb els silencis i el soroll de fons.
- Inclou transcripció ASR, detecció de torns i telefonia.
- OpenAI afirma una millora de +30 punts a Full Duplex Bench respecte a GPT-Realtime-2.1.
- Speak diu que ha mesurat gairebé un 80% menys d'interrupcions que amb sistemes per torns.
- Preu oficial: 0,05 dòlars per minut per la capa de veu; el backend es factura a part.
- Data oficial de l'anunci: 10 de setembre del 2026.
Què és GPT-Live-1
OpenAI defineix GPT-Live-1 com una capa de veu per a la seva API que treballa en full-duplex: escolta i parla alhora, sense esperar que l'interlocutor acabi per començar a respondre. Aquí hi ha la diferència amb els sistemes conversacionals que funcionen per torns.
L'empresa insisteix en un punt: les interrupcions les gestiona un únic model d'àudio. No hi ha diverses peces coordinant-se per detectar que algú talla la frase; el mateix model que genera el so resol la situació.
La pàgina oficial hi afegeix que GPT-Live-1 també se'n surt amb els silencis i el soroll, just on acostumen a fallar els sistemes per torns: una pausa es confon amb el final de la intervenció, i el soroll ambiental, amb algú que comença a parlar.
Com es reparteix la feina amb un model de text
OpenAI remarca que GPT-Live-1 pot delegar el raonament i l'ús d'eines a un model de text. La capa de veu es queda la conversa parlada; allò que demana pensar més o accedir a funcions externes se'n va cap a un altre component.
Aquest repartiment explica com està muntat el preu: els 0,05 dòlars per minut paguen la capa de veu, i el backend es factura a part. Qui construeixi sobre GPT-Live-1 té, doncs, dues factures per calcular, no una.
Control de la veu i funcions que ja venen incloses
Segons la pàgina oficial, el desenvolupador pot controlar el to, el ritme i l'estil de la veu generada. Això compta per a qui dissenya assistents amb una identitat sonora pròpia o necessita canviar la cadència segons el context.
El paquet incorpora, a més, transcripció ASR, detecció de torns i telefonia. Són les tres peces que calen per posar un assistent de veu en producció: convertir l'àudio en text, saber a qui toca parlar i connectar el sistema amb la xarxa telefònica.
Què diuen les xifres i qui les signa
OpenAI afirma una millora de +30 punts a Full Duplex Bench respecte a GPT-Realtime-2.1. La dada surt de l'anunci de la mateixa empresa; ningú de fora no ho ha mesurat.
Speak, per la seva banda, diu que ha observat gairebé un 80% menys d'interrupcions que amb sistemes per torns. Convé dir també d'on surt: són proves internes de l'empresa que fa servir la tecnologia, recollides al material de llançament.
Les dues xifres apunten al mateix, una conversa amb menys talls, però les signa qui té interès en el resultat. Mentre no hi hagi avaluacions externes que qualsevol pugui repetir, el més assenyat és llegir-les tal com són: dades declarades per qui llança la tecnologia i per qui ja la fa servir.
Conclusió
GPT-Live-1 porta a l'API d'OpenAI una conversa que no espera torns: escolta mentre parla, talla i es deixa tallar. La proposta tècnica és clara —un sol model d'àudio per a les interrupcions, el raonament delegat a un model de text i un paquet amb ASR, detecció de torns i telefonia— i el preu de la capa de veu ja està publicat: 0,05 dòlars per minut, amb el backend a part. Les millores quantificades, en canvi, continuen sent paraula d'OpenAI i de Speak. La distància entre allò anunciat i allò comprovable la mesuraran els desenvolupadors, que ja el poden provar.
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios