Modelos

Gemini 3.8 Live: te habla mientras busca la respuesta

Google presentó el 15 de septiembre de 2026 Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos que trabajan directamente con el sonido: entra audio y sale audio, sin un texto intermedio expuesto por el camino. Ejecutan herramientas y llamadas a API en segundo plano sin cortar la conversación, procesan lo que ven en directo y saltan entre 97 lenguas a mitad de frase. Los resultados de bancos de pruebas que acompañan al lanzamiento los mide y los comunica la propia Google.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Gemini 3.8 Live: te habla mientras busca la respuesta
📷 Imagen generada con IA

En resumen

  • Google presentó los dos modelos el 15 de septiembre de 2026: Gemini 3.8 Live, el barato y pensado para conversar, y Gemini 3.8 Live Extended Thinking, para tareas complejas.
  • Son modelos de conversión de voz a voz: procesan el audio de entrada y devuelven audio, sin pasar por un texto intermedio expuesto.
  • Detectan el idioma y cambian entre las 97 lenguas que soportan de forma automática, también en mitad de la conversación.
  • El audio cuesta 0,005 dólares por minuto de entrada y 0,018 de salida en la API de Gemini y en Google AI Studio, según el medio especializado MarkTechPost.
  • En el Speech to Speech Quality Index de Artificial Analysis, Extended Thinking marca 82,6 y encabeza la lista, según las cifras que publica la propia Google.

Dos modelos que trabajan el sonido sin convertirlo en texto

El 15 de septiembre de 2026 Google presentó dos modelos hermanos. Gemini 3.8 Live es el barato y está pensado para sostener una conversación; Gemini 3.8 Live Extended Thinking asume las tareas complejas y encadena razonamiento de varios pasos mientras habla, en lugar de callarse para pensar.

Los dos son modelos de conversión de voz a voz: entra audio y sale audio, sin un texto intermedio expuesto. Ahí está la diferencia con el asistente de voz clásico, y de ahí salen el resto de las novedades del anuncio.

El audio cuesta 0,005 dólares por minuto de entrada y 0,018 de salida en la API de Gemini y en Google AI Studio, cifras que recoge MarkTechPost, un medio especializado en inteligencia artificial.

Leer más: Google — Gemini 3.8 Live y 3.8 Live Extended Thinking ↗

La conversación no se detiene mientras el modelo trabaja por detrás

Lo interesante no es el número de versión, sino el momento en que el modelo deja de hablar. No lo deja: ejecuta herramientas y llamadas a API en segundo plano mientras la charla sigue fluyendo, así que el usuario no se queda esperando a que termine de consultar.

A eso se suma la entrada visual en directo, con anclaje visual en tiempo real: el modelo procesa lo que está viendo en ese momento y lo usa mientras la conversación avanza.

El cambio de idioma va por el mismo camino. El modelo detecta la lengua y salta entre las 97 que soporta de forma automática, sin que nadie se lo pida y aunque el salto ocurra en mitad de una frase.

Las cifras de los bancos de pruebas las comunica Google

Resultados de Gemini 3.8 Live en bancos de pruebas
Prueba Modelo Resultado
Speech to Speech Quality Index (Artificial Analysis) Gemini 3.8 Live Extended Thinking 82,6 — primer puesto
Big Bench Audio Gemini 3.8 Live Extended Thinking 97,7 %
τ-Voice (finalización de tareas agénticas) Gemini 3.8 Live Extended Thinking 68,6 %
τ-Voice-banking (Sierra) Gemini 3.8 Live Extended Thinking 35,1 %
Speech Agent Arena Gemini 3.8 Live segundo puesto
Resultados medidos y comunicados por Google en su propio anuncio; no son una evaluación independiente. El Speech to Speech Quality Index lo mantiene Artificial Analysis y la prueba τ-Voice-banking, Sierra.

El anuncio llega con cinco resultados. El Speech to Speech Quality Index lo mantiene Artificial Analysis, una casa de análisis independiente que publica índices comparativos de modelos de IA; ahí Google coloca a Extended Thinking en el primer puesto con 82,6. La prueba τ-Voice-banking es obra de Sierra, una empresa estadounidense de agentes de atención al cliente.

La advertencia pesa más que cualquiera de los números: quien ha hecho y difundido estas mediciones es Google, la empresa que vende el modelo. No son una evaluación independiente. Y tampoco hay comparación con modelos rivales, porque no hay cifras publicadas lado a lado que permitan ponerlos juntos sin inventárselo.

Leer más: Google DeepMind — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking ↗

Se puede usar desde el primer día, y el audio sale marcado

La disponibilidad arrancó el mismo día del anuncio. Para quien programa, en la API de Gemini y en Google AI Studio. Para las empresas, en vista previa privada dentro de Gemini Enterprise, y más adelante en Gemini Enterprise for Customer Experience. Y para el público general, en Search Live, en la aplicación Gemini Live y en Google Workspace —Docs, Gmail y Keep—, según el plan contratado: AI Pro, Ultra o todos los suscriptores.

Google publica además una lista de integraciones de partida, las plataformas por las que otros desarrolladores pueden enchufar estos modelos: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents. Como socios empresariales cita a Salesforce, Genspark y Lumeris.

Todo el audio generado lleva SynthID, así que lo que salga de estos modelos queda marcado por dentro.

Leer más: MarkTechPost — Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking ↗

Conclusión

Gemini 3.8 Live no cambia lo que un asistente de voz sabe hacer, sino cuándo se calla. Trabajar el sonido sin pasarlo por texto le permite consultar por detrás, mirar lo que tiene delante y cambiar de idioma sin romper el turno de palabra, que es justo donde los asistentes anteriores delataban a la máquina. Queda lo de siempre: las cifras que sostienen el lanzamiento son de casa, y habrá que esperar a que alguien de fuera mida lo mismo con las mismas pruebas antes de dar el primer puesto por bueno.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog