Producte
Google posa cara a Gemini 3.8 Live
El 24 de setembre de 2026, Google va posar cara al seu model conversacional: Live Avatar és una figura humana en vídeo generat gairebé en temps real, sincronitzada amb el que diu el model. La novetat no són els 97 idiomes, que ja venien del setembre, sinó que la sincronització labial i les expressions es mantenen quan es canvia de llengua. Ho explica Google, que ven el producte.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- El 24 de setembre de 2026, Google va posar Gemini 3.8 Live amb Live Avatar en disponibilitat general dins de Gemini Enterprise, el seu paquet per a empreses.
- El que és nou: aquesta cara aguanta el salt entre els 97 idiomes «sense degradar la fidelitat del vídeo ni introduir deriva visual», segons Google; els 97 ja venien del model del 15 de setembre de 2026.
- S'ofereix amb punts d'accés als Estats Units i a la Unió Europea i governança estricta de les dades; Google no esmenta cap regió ni parla de residència de dades.
- Els avatars propis van «només per llista blanca d'empresa», tot l'àudio i el vídeo generats porten marca d'aigua SynthID, i no hi ha preu ni límit de sessió publicats.
La novetat és que la cara aguanta el canvi d'idioma
Gemini 3.8 Live ja conversava des del 15 de setembre de 2026: entrava àudio i sortia àudio. El 24 de setembre s'hi va sumar una cara: el vídeo que genera Gemini mentre respon. Google ho resumeix com a «presència visual gairebé en temps real» i ho descriu amb tres qualitats: sincronització labial precisa, expressions naturals i torns de paraula fluids. Ningú de fora no n'ha mesurat cap, i aquell «gairebé» no ve amb cap xifra.
La novetat concreta rau en el canvi de llengua: Google escriu que l'avatar «adapta dinàmicament la seva sincronització labial i les seves expressions i pot transitar sense costures entre 97 idiomes sense degradar la fidelitat del vídeo ni introduir deriva visual». Aquests 97 idiomes, amb detecció automàtica, no són l'estrena: venien amb el model del 15 de setembre. El que s'estrena és que la boca i el gest no es desajustin en canviar, i de la llista d'idiomes Google no publica res.
Què feia el model de setembre i què afegeix l'avatar
| Capacitat | Gemini 3.8 Live (15-09-2026) | Amb Live Avatar (24-09-2026) |
|---|---|---|
| Sortida | Veu: entra àudio i surt àudio | Veu i vídeo generat gairebé en temps real |
| Idiomes | 97, amb detecció automàtica | Els mateixos 97, i la sincronització labial i les expressions es mantenen quan es canvia d'un idioma a un altre |
| Entrada visual | Processa el que veu en directe | Càmera en directe i pantalla compartida, al costat de l'àudio i a la vegada |
| Torns de paraula | Executa eines sense tallar la conversa | Torns de paraula fluids, sincronitzats amb la imatge |
| Personalització | Veus | Avatar propi a partir d'una imatge de referència, només per llista blanca d'empresa |
| On | API de Gemini i Google AI Studio | Disponibilitat general a Gemini Enterprise, amb punts d'accés als Estats Units i a la Unió Europea |
| Marca d'aigua | SynthID a l'àudio | SynthID a l'àudio i al vídeo |
El quadre de sota separa el que és heretat del que és nou. El capítol anterior és del 15 de setembre de 2026: Gemini 3.8 Live va arribar amb la conversió de veu a veu, els 97 idiomes i l'execució d'eines sense tallar la conversa; la veu feta a mida, el 23 de setembre.
Punts d'accés als Estats Units i a la Unió Europea
El detall de la disponibilitat no és a l'anunci del 24 de setembre, sinó al blog de Google Cloud del dia següent, signat per Fabien Blanc-paques, responsable de producte de Gemini Live. Allà es llegeix que Gemini 3.8 Live amb Live Avatar «ja està disponible amb punts d'accés dels Estats Units i de la Unió Europea, amb rendiment aprovisionat, compliment normatiu empresarial i governança estricta de les dades». «Rendiment aprovisionat» és capacitat reservada per endavant.
El que allà no es diu importa igual: Google no esmenta cap regió concreta, no fa servir l'expressió «residència de dades» i no afirma que el punt d'accés europeu respongui més de pressa a qui es connecta des d'Europa. Sí que precisa l'entrada visual: la comprensió visual en directe «pot processar senyals de càmera en directe i pantalles compartides al costat de l'àudio, tot a la vegada».
L'avatar propi va per invitació i el preu no apareix
Una organització pot donar a l'avatar la cara que vulgui a partir d'una imatge de referència d'alta qualitat, i conservar l'aspecte d'una persona o l'estil d'una marca. La lletra petita la posa Google al mateix anunci: aquesta creació està disponible «només per llista blanca d'empresa».
De diners, res. Cap dels dos anuncis no dona preu, quota ni límit de sessió, i el de Google Cloud remet a la pàgina de tarifes sense avançar cap xifra. Tampoc no hi ha cap identificador de model publicat per a l'avatar.
Conclusió
Live Avatar és sobretot una promesa de continuïtat: el mateix model que ja parlava 97 idiomes els posa ara en una cara que, segons Google, no es desajusta quan canvia de llengua. Falta el que ho faria comparable: una xifra de retard, la llista d'idiomes, una tarifa i algú de fora que ho mesuri.
Fonts primàries
- Google — «Introducing Gemini 3.8 Live with Live Avatar» (24-09-2026) ↗
- Google Cloud — «Gemini 3.8 Live with Live Avatar is now generally available» (Fabien Blanc-paques, 25-09-2026) ↗
- Google Cloud — Gemini Enterprise Agent Platform, pàgina de preus ↗
- Google — «Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking» (15-09-2026) ↗
- AI Informator — «Gemini 3.8 Live: et parla mentre busca la resposta» ↗
- AI Informator — «Gemini 3.8 TTS: descriu una veu i l'API te la fabrica» ↗
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios