Aprenent IA

Gemini 3.8 TTS: descriu una veu i l'API te la fabrica

El 23 de setembre de 2026 Google va llançar Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS, els seus nous models de síntesi de veu. Amb ells n'hi ha prou de descriure en una o dues frases la veu que vols: l'API la crea, la desa i la fa parlar. Aquest curs breu t'ho ensenya pas a pas.

Caricatura d'un apotecari calb amb ulleres rodones que tira en un matràs de vidre una ploma, uns grans de grava i una cullerada de mel mentre es porta la mà a l'orella; del matràs en surt una veu com una columna de fum vermell i blau que acaba en ona sonora, al costat d'un morter amb l'espurna de Gemini.
📷 Imatge generada amb IA

En resum

  • Google va publicar el 23 de setembre de 2026 dos models de síntesi de veu: `gemini-3.8-flash-tts`, el de més qualitat, i `gemini-3.8-flash-lite-tts`, el barat per a grans volums.
  • El disseny de veu crea una veu nova a partir d'una descripció escrita i la desa al teu projecte amb un identificador que comença per `voice_`.
  • Fins al 31 de desembre de 2026, una hora d'àudio costa 0,81 $ amb Flash TTS i 0,54 $ amb Flash-Lite TTS, segons un càlcul nostre; a partir del 2027 els preus es dupliquen.
  • Tot l'àudio surt amb SynthID, una marca d'aigua inaudible, i la política de Google prohibeix suplantar una persona per enganyar.

Una veu que no existia, feta amb paraules

Google va presentar el 23 de setembre de 2026 dos models de veu. Gemini 3.8 Flash TTS està pensat, segons l'empresa, per a la direcció creativa i el disseny de personatges; Gemini 3.8 Flash-Lite TTS, per a doblatge, continguts d'àudio i agents de veu a gran escala i amb poc cost.

Tots dos comparteixen el mateix esquema d'API: es passa de l'un a l'altre canviant només el camp `model`. I tots dos permeten el més cridaner del llançament: inventar una veu descrivint-la amb paraules. En aquest curs la crees, l'escoltes, la fas parlar en castellà, la dirigeixes i deses el resultat.

Pas 0: la clau i el paquet de Python

Crea una clau de l'API de Gemini a Google AI Studio, el web de Google per provar els seus models, i desa-la a la variable d'entorn `GEMINI_API_KEY`: el client oficial la llegeix d'allà, sense enganxar-la a cap fitxer. No l'ensenyis en captures ni la pugis a un repositori.

Després instal·la el paquet oficial de Python, `google-genai`, en la versió 2.25.0 o posterior, la primera que inclou les funcions de veu: `pip install -U google-genai`. Si prefereixes no programar, l'estudi de disseny de veu d'AI Studio fa el mateix amb formularis i et dona l'identificador `voice_...` per copiar-lo.

Pas 1: descriu la veu en una o dues frases

La veu es crea amb `client.voices.create`, amb `store=True` perquè quedi desada i un objecte `voice` amb aquests camps: `model` (`gemini-3.8-flash-tts`), `type` amb el valor `prompted`, un nom a `display_name`, `gender`, `language_code` i, dins de `prompted`, el camp `input` amb la descripció.

La documentació demana descriure els trets que no canvien: edat, gènere, timbre, textura i accent regional. Una o dues frases concretes funcionen millor que un paràgraf llarg o contradictori. El seu exemple és un astrònom britànic de seixanta i tants anys, càlid i reflexiu, amb `language_code` en `en-GB`.

Per a una veu en castellà, canvia la descripció al castellà i `language_code` a `es-ES`. Aquesta adaptació és nostra: Google no publica cap exemple de disseny de veu en castellà, així que no hi ha garantia sobre el resultat. Per exemple: «Una locutora de radio de unos cuarenta años, voz grave y cálida, habla con calma».

Pas 2: escolta la mostra abans de continuar

La resposta de `voices.create` porta `id`, l'identificador permanent de la teva veu, que comença per `voice_` i és el que faràs servir per fer-la parlar, i `sample_audio`, una mostra en WAV codificada en base64.

Descodifica `sample_audio.data` amb el mòdul `base64` i desa-ho com a `voice_preview.wav`. Si la veu no és la que t'imaginaves, no l'arreglis després amb instruccions d'estil: canvia la descripció i crea'n una altra. La mostra només arriba en crear la veu o en consultar-la amb `voices.get`.

Pas 3: fes-la parlar en castellà

Per sintetitzar es fa servir `client.interactions.create`. Li passes `model`, un `input` de tipus `user_input` amb el teu text dins de `content`, `response_format` amb `type` igual a `audio` i, a `generation_config`, un `speech_config` que és una llista amb la teva veu: `[{"voice": created_voice.id}]`.

Fes la primera prova sense cap indicació d'estil: segons la documentació, la majoria de peticions no la necessiten. L'idioma es detecta sol, i el castellà, el català, el gallec i el basc són entre els admesos.

L'àudio arriba en base64 a `interaction.output_audio.data`. Descodifica'l i desa'l directament com a `.wav`: a diferència dels models anteriors, aquests ja lliuren un WAV complet. Per a altres formats, `response_format` admet un `mime_type`, com ara `audio/l16` per a PCM sense capçalera.

Pas 4: dirigeix la interpretació sense que es llegeixi

A Gemini 3.8 TTS el camp `text` és una transcripció literal: el que hi escriguis es diu. Per dirigir, s'afegeix al contingut una anotació de tipus `speech_metadata` amb un camp `style`, com ara `reflective and awe-inspired` o `speaking slowly`.

Aquest estil val per a tot el torn i convé que sigui breu. L'edat, el gènere o l'accent no hi van: són de la veu. I, segons la documentació, com més text sobra, més tendeix la veu a desviar-se, i els blocs llargs de notes de direcció en són la causa més freqüent. Si l'emoció canvia a mig text, parteix-lo en dos torns.

Pas 5: sospirs i pauses al punt exacte

Per al que és puntual es fan servir etiquetes: `<short pause>` i `<long pause>` per al ritme, i gestos com `<sigh>`, `<laugh>` o `<whispers>`. En un text en castellà es queden en anglès, que és com funcionen millor segons la guia: «Espera... <short pause> ¿has oído eso? <sigh>».

Una paraula en MAJÚSCULES rep èmfasi. Evita les etiquetes d'efectes de so, com aplaudiments o cops. En acabar, comprova que cap etiqueta no s'ha llegit en veu alta.

Pas 6: un diàleg a dues veus

Amb veus predissenyades, el diàleg surt en una sola crida: `speech_config` passa a portar `mode` amb el valor `conversational` i una llista `speakers` que associa cada personatge a una veu, com ara `{"speaker": "Jane", "voice": "Kore"}`. Cada torn porta la seva `speech_metadata` amb el `speaker` que parla. El màxim és de dos parlants.

Amb veus dissenyades, la documentació indica que cal demanar cada torn per separat i unir després l'àudio PCM de 24 kHz. Per buscar veus ja fetes, `client.voices.list` filtra per `language_code`, `accent`, `gender` o `pitch`; la documentació parla de centenars de veus addicionals i l'anunci de Google, de més de 2.000.

Pas 7: calcula el que costa i fes neteja

Els dos models, colze a colze
Característica Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
Identificador d'API gemini-3.8-flash-tts gemini-3.8-flash-lite-tts
Per a què està pensat Màxima fidelitat, interpretació amb matisos i accents regionals Gran volum amb baix cost
Idiomes 130 101
Disseny i rèplica de veu Sí Sí
Parlants per petició 2 (veus predissenyades) 2 (veus predissenyades)
Límit d'entrada / sortida (tokens) 8.192 / 16.384 8.192 / 16.384
Entrada de text, per milió de tokens 0,50 $ 0,50 $
Sortida d'àudio, per milió de tokens 9,00 $ 6,00 $
Sortida d'àudio en Batch o Flex, per milió 4,50 $ 3,00 $
10 segons d'àudio 0,00225 $ 0,0015 $
Un minut d'àudio (càlcul nostre) 0,0135 $ 0,009 $
Una hora d'àudio (càlcul nostre) 0,81 $ 0,54 $
Nivell gratuït Sí Sí
Preus del nivell de pagament Standard publicats per Google a la documentació de l'API de Gemini (actualitzada el 24-09-2026), vigents fins al 31 de desembre de 2026; a partir de l'1 de gener de 2027 es dupliquen. L'àudio es compta a 25 tokens per segon; les files de minut i hora són un càlcul nostre a partir d'aquesta xifra.

Tots dos models tenen nivell gratuït, però en aquest nivell el que envies es pot fer servir per millorar els productes de Google; en el de pagament, no. Google no publica cap preu per crear o desar una veu dissenyada.

Per posar ordre, `client.voices.list(type_=["prompted"])` mostra les teves veus dissenyades i `client.voices.delete` esborra les que sobrin. El límit és de 200 veus per projecte, i les desades caduquen al cap d'un any.

Copiar una veu real exigeix el seu permís

Aquest curs no replica veus per un motiu pràctic: segons l'anunci de Google, la rèplica a través d'AI Studio no està disponible a l'Espai Econòmic Europeu, que inclou Espanya, i no consta si per API sí que ho està. El disseny de veu no té aquesta restricció en cap de les fonts consultades.

La política d'usos prohibits de la IA generativa de Google veta suplantar una persona, viva o morta, sense avisar-ne clarament i per enganyar, i fer servir dades biomètriques sense el consentiment que exigeixi la llei. Fer servir l'API implica acceptar-la, i Google conserva les peticions 55 dies per detectar abusos.

Tot el que sona porta marca d'aigua

Qualsevol fragment que generis surt marcat. Google ho presenta com una manera de fer que la veu sintètica continuï sent detectable i de frenar la desinformació. No canvia el que sents ni com treballes amb el fitxer.

Conclusió

Amb vuit passos, del 0 al 7, es passa d'una frase a un fitxer WAV amb una veu pròpia que parla castellà, sospira quan toca i canvia de to per torns. La clau és separar el que és de la veu, que va a la descripció, del que és de l'escena, que va a `speech_metadata` i a les etiquetes. El preu de llançament és vigent fins al 31 de desembre de 2026; a partir de gener, el doble.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    La continuació natural

    Aprèn IA al teu ritme amb els nostres cursos gratuïts.

    A la nostra plataforma d'aprenentatge TAKU podràs accedir a aquest i a molts altres cursos de manera totalment gratuïta.

    FES AQUEST CURS A TAKU

    ← Torna al blog