Models
Gemini 3.8 Live: et parla mentre busca la resposta
Google va presentar el 15 de setembre de 2026 Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, dos models per a conversió de veu a veu que treballen directament amb el so: entra àudio i surt àudio, sense cap text intermedi exposat pel camí. Executen eines i crides a API en segon pla sense tallar la conversa, processen el que veuen en directe i salten entre 97 llengües a mitja frase. Els resultats dels bancs de proves que acompanyen el llançament els mesura i els comunica la mateixa Google.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Google va presentar els dos models el 15 de setembre de 2026: Gemini 3.8 Live, el barat i pensat per conversar, i Gemini 3.8 Live Extended Thinking, per a tasques complexes.
- Són models per a conversió de veu a veu: processen l'àudio d'entrada i tornen àudio, sense passar per un text intermedi exposat.
- Detecten l'idioma i canvien entre les 97 llengües que admeten de manera automàtica, també a mitja conversa.
- L'àudio costa 0,005 dòlars per minut d'entrada i 0,018 de sortida a l'API de Gemini i a Google AI Studio, segons el mitjà especialitzat MarkTechPost.
- Al Speech to Speech Quality Index d'Artificial Analysis, Extended Thinking marca 82,6 i encapçala la llista, segons les xifres que publica la mateixa Google.
Dos models que treballen el so sense convertir-lo en text
El 15 de setembre de 2026 Google va presentar dos models germans. Gemini 3.8 Live és el barat i està pensat per sostenir una conversa; Gemini 3.8 Live Extended Thinking assumeix les tasques complexes i encadena raonament de diversos passos mentre parla, en comptes de callar per pensar.
Tots dos són models per a conversió de veu a veu: entra àudio i surt àudio, sense un text intermedi exposat. Aquí hi ha la diferència amb l'assistent de veu clàssic, i d'aquí surt la resta de novetats de l'anunci.
L'àudio costa 0,005 dòlars per minut d'entrada i 0,018 de sortida a l'API de Gemini i a Google AI Studio, xifres que recull MarkTechPost, un mitjà especialitzat en intel·ligència artificial.
Llegir-ne més: Google — Gemini 3.8 Live i 3.8 Live Extended Thinking ↗
La conversa no s'atura mentre el model treballa per darrere
El que és interessant no és el número de versió, sinó el moment en què el model deixa de parlar. No el deixa: executa eines i crides a API en segon pla mentre la xerrada continua fluint, així que l'usuari no es queda esperant que acabi de consultar.
A això s'hi suma l'entrada visual en directe, amb ancoratge visual en temps real: el model processa el que està veient en aquell moment i ho fa servir mentre la conversa avança.
El canvi d'idioma va pel mateix camí. El model detecta la llengua i salta entre les 97 que admet de manera automàtica, sense que ningú l'hi demani i encara que el salt passi a mitja frase.
Les xifres dels bancs de proves les comunica Google
| Prova | Model | Resultat |
|---|---|---|
| Speech to Speech Quality Index (Artificial Analysis) | Gemini 3.8 Live Extended Thinking | 82,6 — primer lloc |
| Big Bench Audio | Gemini 3.8 Live Extended Thinking | 97,7 % |
| τ-Voice (finalització de tasques agèntiques) | Gemini 3.8 Live Extended Thinking | 68,6 % |
| τ-Voice-banking (Sierra) | Gemini 3.8 Live Extended Thinking | 35,1 % |
| Speech Agent Arena | Gemini 3.8 Live | segon lloc |
L'anunci arriba amb cinc resultats. El Speech to Speech Quality Index el manté Artificial Analysis, una casa d'anàlisi independent que publica índexs comparatius de models d'IA; allà Google col·loca Extended Thinking al primer lloc amb 82,6. La prova τ-Voice-banking és obra de Sierra, una empresa estatunidenca d'agents d'atenció al client.
L'advertiment pesa més que qualsevol dels números: qui ha fet i ha difós aquests mesuraments és Google, l'empresa que ven el model. No són una avaluació independent. I tampoc no hi ha comparació amb models rivals, perquè no hi ha xifres publicades una al costat de l'altra que permetin posar-los junts sense inventar-s'ho.
Llegir-ne més: Google DeepMind — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking ↗
Es pot fer servir des del primer dia, i l'àudio surt marcat
La disponibilitat va arrencar el mateix dia de l'anunci. Per a qui programa, a l'API de Gemini i a Google AI Studio. Per a les empreses, en vista prèvia privada dins de Gemini Enterprise, i més endavant a Gemini Enterprise for Customer Experience. I per al públic general, a Search Live, a l'aplicació Gemini Live i a Google Workspace —Docs, Gmail i Keep—, segons el pla contractat: AI Pro, Ultra o tots els subscriptors.
Google publica, a més, una llista d'integracions inicials, les plataformes per les quals altres desenvolupadors poden endollar aquests models: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents. Com a socis empresarials cita Salesforce, Genspark i Lumeris.
Tot l'àudio generat porta SynthID, així que el que surti d'aquests models queda marcat per dins.
Llegir-ne més: MarkTechPost — Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking ↗
Conclusió
Gemini 3.8 Live no canvia el que un assistent de veu sap fer, sinó quan calla. Treballar el so sense passar-lo per text li permet consultar per darrere, mirar el que té al davant i canviar d'idioma sense trencar el torn de paraula, que és just on els assistents anteriors delataven la màquina. Queda el de sempre: les xifres que sostenen el llançament són de casa, i caldrà esperar que algú de fora mesuri el mateix amb les mateixes proves abans de donar el primer lloc per bo.
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios