Models

Gemini 3.8 Live: et parla mentre busca la resposta

Google va presentar el 15 de setembre de 2026 Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, dos models per a conversió de veu a veu que treballen directament amb el so: entra àudio i surt àudio, sense cap text intermedi exposat pel camí. Executen eines i crides a API en segon pla sense tallar la conversa, processen el que veuen en directe i salten entre 97 llengües a mitja frase. Els resultats dels bancs de proves que acompanyen el llançament els mesura i els comunica la mateixa Google.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Gemini 3.8 Live: te habla mientras busca la respuesta
📷 Imatge generada amb IA

En resum

  • Google va presentar els dos models el 15 de setembre de 2026: Gemini 3.8 Live, el barat i pensat per conversar, i Gemini 3.8 Live Extended Thinking, per a tasques complexes.
  • Són models per a conversió de veu a veu: processen l'àudio d'entrada i tornen àudio, sense passar per un text intermedi exposat.
  • Detecten l'idioma i canvien entre les 97 llengües que admeten de manera automàtica, també a mitja conversa.
  • L'àudio costa 0,005 dòlars per minut d'entrada i 0,018 de sortida a l'API de Gemini i a Google AI Studio, segons el mitjà especialitzat MarkTechPost.
  • Al Speech to Speech Quality Index d'Artificial Analysis, Extended Thinking marca 82,6 i encapçala la llista, segons les xifres que publica la mateixa Google.

Dos models que treballen el so sense convertir-lo en text

El 15 de setembre de 2026 Google va presentar dos models germans. Gemini 3.8 Live és el barat i està pensat per sostenir una conversa; Gemini 3.8 Live Extended Thinking assumeix les tasques complexes i encadena raonament de diversos passos mentre parla, en comptes de callar per pensar.

Tots dos són models per a conversió de veu a veu: entra àudio i surt àudio, sense un text intermedi exposat. Aquí hi ha la diferència amb l'assistent de veu clàssic, i d'aquí surt la resta de novetats de l'anunci.

L'àudio costa 0,005 dòlars per minut d'entrada i 0,018 de sortida a l'API de Gemini i a Google AI Studio, xifres que recull MarkTechPost, un mitjà especialitzat en intel·ligència artificial.

Llegir-ne més: Google — Gemini 3.8 Live i 3.8 Live Extended Thinking ↗

La conversa no s'atura mentre el model treballa per darrere

El que és interessant no és el número de versió, sinó el moment en què el model deixa de parlar. No el deixa: executa eines i crides a API en segon pla mentre la xerrada continua fluint, així que l'usuari no es queda esperant que acabi de consultar.

A això s'hi suma l'entrada visual en directe, amb ancoratge visual en temps real: el model processa el que està veient en aquell moment i ho fa servir mentre la conversa avança.

El canvi d'idioma va pel mateix camí. El model detecta la llengua i salta entre les 97 que admet de manera automàtica, sense que ningú l'hi demani i encara que el salt passi a mitja frase.

Les xifres dels bancs de proves les comunica Google

Resultats de Gemini 3.8 Live en bancs de proves
Prova Model Resultat
Speech to Speech Quality Index (Artificial Analysis) Gemini 3.8 Live Extended Thinking 82,6 — primer lloc
Big Bench Audio Gemini 3.8 Live Extended Thinking 97,7 %
τ-Voice (finalització de tasques agèntiques) Gemini 3.8 Live Extended Thinking 68,6 %
τ-Voice-banking (Sierra) Gemini 3.8 Live Extended Thinking 35,1 %
Speech Agent Arena Gemini 3.8 Live segon lloc
Resultats mesurats i comunicats per Google en el seu propi anunci; no són una avaluació independent. El Speech to Speech Quality Index el manté Artificial Analysis i la prova τ-Voice-banking, Sierra.

L'anunci arriba amb cinc resultats. El Speech to Speech Quality Index el manté Artificial Analysis, una casa d'anàlisi independent que publica índexs comparatius de models d'IA; allà Google col·loca Extended Thinking al primer lloc amb 82,6. La prova τ-Voice-banking és obra de Sierra, una empresa estatunidenca d'agents d'atenció al client.

L'advertiment pesa més que qualsevol dels números: qui ha fet i ha difós aquests mesuraments és Google, l'empresa que ven el model. No són una avaluació independent. I tampoc no hi ha comparació amb models rivals, perquè no hi ha xifres publicades una al costat de l'altra que permetin posar-los junts sense inventar-s'ho.

Llegir-ne més: Google DeepMind — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking ↗

Es pot fer servir des del primer dia, i l'àudio surt marcat

La disponibilitat va arrencar el mateix dia de l'anunci. Per a qui programa, a l'API de Gemini i a Google AI Studio. Per a les empreses, en vista prèvia privada dins de Gemini Enterprise, i més endavant a Gemini Enterprise for Customer Experience. I per al públic general, a Search Live, a l'aplicació Gemini Live i a Google Workspace —Docs, Gmail i Keep—, segons el pla contractat: AI Pro, Ultra o tots els subscriptors.

Google publica, a més, una llista d'integracions inicials, les plataformes per les quals altres desenvolupadors poden endollar aquests models: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents. Com a socis empresarials cita Salesforce, Genspark i Lumeris.

Tot l'àudio generat porta SynthID, així que el que surti d'aquests models queda marcat per dins.

Llegir-ne més: MarkTechPost — Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking ↗

Conclusió

Gemini 3.8 Live no canvia el que un assistent de veu sap fer, sinó quan calla. Treballar el so sense passar-lo per text li permet consultar per darrere, mirar el que té al davant i canviar d'idioma sense trencar el torn de paraula, que és just on els assistents anteriors delataven la màquina. Queda el de sempre: les xifres que sostenen el llançament són de casa, i caldrà esperar que algú de fora mesuri el mateix amb les mateixes proves abans de donar el primer lloc per bo.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog