Google ha empezado a desplegar Gemini 3.8 Flash TTS y Flash-Lite TTS, sus nuevos modelos de texto a voz pensados para generar audio artificial mucho más expresivo. La actualización permite clonar voces autorizadas a partir de una muestra breve y dirigir guiones con matices emocionales, acentos y pausas, un salto respecto a la locución sintética que conocíamos hasta ahora.
El cambio que más vamos a notar los usuarios es el control sobre la interpretación. Hasta ahora, lograr que una voz sintética leyera un guion con el acento, el ritmo, la emoción o las pausas adecuadas no resultaba sencillo. Google lleva semanas haciendo crecer Gemini 3.8 a partir del Flash original, dando lugar a los modelos Live y Live Extended Thinking, y ahora extiende esa evolución a la voz: Flash TTS y Flash-Lite TTS ya incorporan suspiros, risas y cambios de tono línea por línea, como si un actor interpretara el texto en lugar de leerlo.
Cómo funciona la clonación de voz en Gemini
Si trabajáis con creación de contenido, la personalización es el punto fuerte de esta actualización. Gemini 3.8 Flash TTS genera una voz original a partir de una descripción en lenguaje natural, con soporte para más de 100 idiomas y dialectos, y ofrece un catálogo de más de 2.000 voces listas para producción.
La función de replicación reconstruye una identidad vocal a partir de una muestra de solo 30 segundos, siempre que exista permiso expreso para usarla. El sistema mantiene esa voz coherente durante horas de grabación, lo que abre la puerta a pódcasts, audiolibros, doblajes y agentes conversacionales que necesitan sonar igual episodio tras episodio.
El soporte para más de 100 idiomas y dialectos hace que esta herramienta sirva tanto para proyectos locales como para producciones que necesitan adaptar un mismo guion a varios mercados sin grabar cada versión desde cero. La combinación de voces predefinidas y voces clonadas os da margen para elegir entre partir de cero o reutilizar una identidad vocal ya existente.
Dirección de guion y escenas con dos voces en un audio
Más allá de clonar una voz, los modelos aceptan instrucciones de interpretación línea por línea: cambios de dialecto, susurros, risas y otras señales que antes solo podía dar un actor de doblaje. Por eso el resultado se aleja de la locución plana y se acerca a una interpretación con matices reales.
Otra novedad útil para quienes editan vídeo es la posibilidad de generar conversaciones entre dos hablantes a partir de un único guion. El sistema asigna y conserva cada voz durante toda la escena, así que no hace falta grabar y montar cada pista por separado para conseguir un diálogo que suene natural.
Esta capacidad de mantener la coherencia vocal durante horas de audio es la misma que sustenta el desarrollo de los modelos Live y Live Extended Thinking dentro de la familia Gemini 3.8. De ahí que Google presente estas herramientas como una evolución conjunta: primero mejoró la conversación en tiempo real y ahora traslada ese mismo nivel de control a la locución grabada.
Puntuación en los test de Hume AI
En los benchmarks, Gemini 3.8 Flash TTS ha quedado primero en el Voice Design Benchmark de Hume AI, con 60,8 puntos en la prueba de acentos, y Flash junto con Flash-Lite ocupan las dos primeras plazas del índice general de calidad de ese mismo test. También aparecen entre los primeros puestos en varios idiomas dentro de Voice Arena. ElevenLabs, eso sí, sigue por delante en las categorías de calidad vocal individual y variación humana de Hume AI.
Para el usuario habitual, Flash TTS ya llega a Gemini Notebook y Flash-Lite TTS a Google Vids, herramienta que acaba de abrir su generador de vídeo Omni a más usuarios. Si sois desarrolladores, podéis acceder a ambos modelos desde la API de Gemini y desde Google AI Studio. Google añade además varias barreras para la replicación de voz: exige verificar el consentimiento, incorpora marcas de agua SynthID y credenciales C2PA, y bloquea esta función en AI Studio en el Reino Unido, el Espacio Económico Europeo, la India, Texas e Illinois.
