Aprenent IA
Gemini 3.8 TTS: descriu una veu i l'API te la fabrica
El 23 de setembre de 2026 Google va llançar Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS, els seus nous models de síntesi de veu. Amb ells n'hi ha prou de descriure en una o dues frases la veu que vols: l'API la crea, la desa i la fa parlar. Aquest curs breu t'ho ensenya pas a pas.
En resum
- Google va publicar el 23 de setembre de 2026 dos models de síntesi de veu: `gemini-3.8-flash-tts`, el de més qualitat, i `gemini-3.8-flash-lite-tts`, el barat per a grans volums.
- El disseny de veu crea una veu nova a partir d'una descripció escrita i la desa al teu projecte amb un identificador que comença per `voice_`.
- Fins al 31 de desembre de 2026, una hora d'àudio costa 0,81 $ amb Flash TTS i 0,54 $ amb Flash-Lite TTS, segons un càlcul nostre; a partir del 2027 els preus es dupliquen.
- Tot l'àudio surt amb SynthID, una marca d'aigua inaudible, i la política de Google prohibeix suplantar una persona per enganyar.
Una veu que no existia, feta amb paraules
Google va presentar el 23 de setembre de 2026 dos models de veu. Gemini 3.8 Flash TTS està pensat, segons l'empresa, per a la direcció creativa i el disseny de personatges; Gemini 3.8 Flash-Lite TTS, per a doblatge, continguts d'àudio i agents de veu a gran escala i amb poc cost.
Tots dos comparteixen el mateix esquema d'API: es passa de l'un a l'altre canviant només el camp `model`. I tots dos permeten el més cridaner del llançament: inventar una veu descrivint-la amb paraules. En aquest curs la crees, l'escoltes, la fas parlar en castellà, la dirigeixes i deses el resultat.
Pas 0: la clau i el paquet de Python
Crea una clau de l'API de Gemini a Google AI Studio, el web de Google per provar els seus models, i desa-la a la variable d'entorn `GEMINI_API_KEY`: el client oficial la llegeix d'allà, sense enganxar-la a cap fitxer. No l'ensenyis en captures ni la pugis a un repositori.
Després instal·la el paquet oficial de Python, `google-genai`, en la versió 2.25.0 o posterior, la primera que inclou les funcions de veu: `pip install -U google-genai`. Si prefereixes no programar, l'estudi de disseny de veu d'AI Studio fa el mateix amb formularis i et dona l'identificador `voice_...` per copiar-lo.
Pas 1: descriu la veu en una o dues frases
La veu es crea amb `client.voices.create`, amb `store=True` perquè quedi desada i un objecte `voice` amb aquests camps: `model` (`gemini-3.8-flash-tts`), `type` amb el valor `prompted`, un nom a `display_name`, `gender`, `language_code` i, dins de `prompted`, el camp `input` amb la descripció.
La documentació demana descriure els trets que no canvien: edat, gènere, timbre, textura i accent regional. Una o dues frases concretes funcionen millor que un paràgraf llarg o contradictori. El seu exemple és un astrònom britànic de seixanta i tants anys, càlid i reflexiu, amb `language_code` en `en-GB`.
Per a una veu en castellà, canvia la descripció al castellà i `language_code` a `es-ES`. Aquesta adaptació és nostra: Google no publica cap exemple de disseny de veu en castellà, així que no hi ha garantia sobre el resultat. Per exemple: «Una locutora de radio de unos cuarenta años, voz grave y cálida, habla con calma».
Pas 2: escolta la mostra abans de continuar
La resposta de `voices.create` porta `id`, l'identificador permanent de la teva veu, que comença per `voice_` i és el que faràs servir per fer-la parlar, i `sample_audio`, una mostra en WAV codificada en base64.
Descodifica `sample_audio.data` amb el mòdul `base64` i desa-ho com a `voice_preview.wav`. Si la veu no és la que t'imaginaves, no l'arreglis després amb instruccions d'estil: canvia la descripció i crea'n una altra. La mostra només arriba en crear la veu o en consultar-la amb `voices.get`.
Pas 3: fes-la parlar en castellà
Per sintetitzar es fa servir `client.interactions.create`. Li passes `model`, un `input` de tipus `user_input` amb el teu text dins de `content`, `response_format` amb `type` igual a `audio` i, a `generation_config`, un `speech_config` que és una llista amb la teva veu: `[{"voice": created_voice.id}]`.
Fes la primera prova sense cap indicació d'estil: segons la documentació, la majoria de peticions no la necessiten. L'idioma es detecta sol, i el castellà, el català, el gallec i el basc són entre els admesos.
L'àudio arriba en base64 a `interaction.output_audio.data`. Descodifica'l i desa'l directament com a `.wav`: a diferència dels models anteriors, aquests ja lliuren un WAV complet. Per a altres formats, `response_format` admet un `mime_type`, com ara `audio/l16` per a PCM sense capçalera.
Pas 4: dirigeix la interpretació sense que es llegeixi
A Gemini 3.8 TTS el camp `text` és una transcripció literal: el que hi escriguis es diu. Per dirigir, s'afegeix al contingut una anotació de tipus `speech_metadata` amb un camp `style`, com ara `reflective and awe-inspired` o `speaking slowly`.
Aquest estil val per a tot el torn i convé que sigui breu. L'edat, el gènere o l'accent no hi van: són de la veu. I, segons la documentació, com més text sobra, més tendeix la veu a desviar-se, i els blocs llargs de notes de direcció en són la causa més freqüent. Si l'emoció canvia a mig text, parteix-lo en dos torns.
Pas 5: sospirs i pauses al punt exacte
Per al que és puntual es fan servir etiquetes: `<short pause>` i `<long pause>` per al ritme, i gestos com `<sigh>`, `<laugh>` o `<whispers>`. En un text en castellà es queden en anglès, que és com funcionen millor segons la guia: «Espera... <short pause> ¿has oído eso? <sigh>».
Una paraula en MAJÚSCULES rep èmfasi. Evita les etiquetes d'efectes de so, com aplaudiments o cops. En acabar, comprova que cap etiqueta no s'ha llegit en veu alta.
Pas 6: un diàleg a dues veus
Amb veus predissenyades, el diàleg surt en una sola crida: `speech_config` passa a portar `mode` amb el valor `conversational` i una llista `speakers` que associa cada personatge a una veu, com ara `{"speaker": "Jane", "voice": "Kore"}`. Cada torn porta la seva `speech_metadata` amb el `speaker` que parla. El màxim és de dos parlants.
Amb veus dissenyades, la documentació indica que cal demanar cada torn per separat i unir després l'àudio PCM de 24 kHz. Per buscar veus ja fetes, `client.voices.list` filtra per `language_code`, `accent`, `gender` o `pitch`; la documentació parla de centenars de veus addicionals i l'anunci de Google, de més de 2.000.
Pas 7: calcula el que costa i fes neteja
| Característica | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| Identificador d'API | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
| Per a què està pensat | Màxima fidelitat, interpretació amb matisos i accents regionals | Gran volum amb baix cost |
| Idiomes | 130 | 101 |
| Disseny i rèplica de veu | Sí | Sí |
| Parlants per petició | 2 (veus predissenyades) | 2 (veus predissenyades) |
| Límit d'entrada / sortida (tokens) | 8.192 / 16.384 | 8.192 / 16.384 |
| Entrada de text, per milió de tokens | 0,50 $ | 0,50 $ |
| Sortida d'àudio, per milió de tokens | 9,00 $ | 6,00 $ |
| Sortida d'àudio en Batch o Flex, per milió | 4,50 $ | 3,00 $ |
| 10 segons d'àudio | 0,00225 $ | 0,0015 $ |
| Un minut d'àudio (càlcul nostre) | 0,0135 $ | 0,009 $ |
| Una hora d'àudio (càlcul nostre) | 0,81 $ | 0,54 $ |
| Nivell gratuït | Sí | Sí |
Tots dos models tenen nivell gratuït, però en aquest nivell el que envies es pot fer servir per millorar els productes de Google; en el de pagament, no. Google no publica cap preu per crear o desar una veu dissenyada.
Per posar ordre, `client.voices.list(type_=["prompted"])` mostra les teves veus dissenyades i `client.voices.delete` esborra les que sobrin. El límit és de 200 veus per projecte, i les desades caduquen al cap d'un any.
Copiar una veu real exigeix el seu permís
Aquest curs no replica veus per un motiu pràctic: segons l'anunci de Google, la rèplica a través d'AI Studio no està disponible a l'Espai Econòmic Europeu, que inclou Espanya, i no consta si per API sí que ho està. El disseny de veu no té aquesta restricció en cap de les fonts consultades.
La política d'usos prohibits de la IA generativa de Google veta suplantar una persona, viva o morta, sense avisar-ne clarament i per enganyar, i fer servir dades biomètriques sense el consentiment que exigeixi la llei. Fer servir l'API implica acceptar-la, i Google conserva les peticions 55 dies per detectar abusos.
Tot el que sona porta marca d'aigua
Qualsevol fragment que generis surt marcat. Google ho presenta com una manera de fer que la veu sintètica continuï sent detectable i de frenar la desinformació. No canvia el que sents ni com treballes amb el fitxer.
Conclusió
Amb vuit passos, del 0 al 7, es passa d'una frase a un fitxer WAV amb una veu pròpia que parla castellà, sospira quan toca i canvia de to per torns. La clau és separar el que és de la veu, que va a la descripció, del que és de l'escena, que va a `speech_metadata` i a les etiquetes. El preu de llançament és vigent fins al 31 de desembre de 2026; a partir de gener, el doble.
Fonts primàries
- Google — Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS (23-09-2026) ↗
- Google AI for Developers — Text-to-speech generation (TTS) ↗
- Google AI for Developers — Voice design ↗
- Google AI for Developers — Voice replication ↗
- Google AI for Developers — Gemini 3.8 Flash TTS ↗
- Google AI for Developers — Gemini 3.8 Flash-Lite TTS ↗
- Google AI for Developers — Gemini Developer API pricing ↗
- Google AI for Developers — Usage policies ↗
- Google — Generative AI Prohibited Use Policy ↗
- Google AI Studio — Generate speech (Flash TTS) ↗
- AI Informator — Gemini 3.8 Live: et parla mentre busca la resposta ↗
- AI Informator — Els secrets de la marca d'aigua de Claude ↗
La continuació natural
Aprèn IA al teu ritme amb els nostres cursos gratuïts.
A la nostra plataforma d'aprenentatge TAKU podràs accedir a aquest i a molts altres cursos de manera totalment gratuïta.
FES AQUEST CURS A TAKU
Comentarios