
Imagen para ayudar a comprender el artículo
Dos nuevos modelos de voz llegan a Gemini
Google presentó el 23 de septiembre de 2026 Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de generación de voz centrados en la personalización y la reproducción de acentos. Ambos comenzaron a ofrecerse mediante Gemini API y Google AI Studio con los identificadores gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts.
La disponibilidad en la API de Gemini Enterprise llegará más adelante. Mientras tanto, Gemini 3.8 Flash TTS puede utilizarse en Gemini Notebook y la versión Flash-Lite TTS está disponible en Google Vids para todos los usuarios.
Según The Next Web, los modelos admiten más de 100 idiomas y dialectos, además de superar las 2.000 voces prediseñadas. La edición Flash TTS también permite clonar una voz a partir de una muestra de 30 segundos, después de un proceso de verificación del consentimiento. Esta función no se ofrece a través de Google AI Studio en Illinois, Texas, el Espacio Económico Europeo, Reino Unido, Suiza ni India.
Marcas de agua y dudas sobre la verificación
Todo el audio creado con los modelos Gemini Audio incorpora la marca de agua SynthID para facilitar la identificación de voces generadas con inteligencia artificial. Las voces clonadas incluyen además credenciales de contenido C2PA.
RuntimeWire señaló, sin embargo, que al momento del lanzamiento Google no había detallado el funcionamiento del proceso de verificación del consentimiento ni publicado cifras concretas sobre latencia y límites de uso. Tampoco existía una validación independiente de esos aspectos.
Los resultados cambian según el benchmark
Google aseguró que Gemini 3.8 Flash TTS obtuvo el primer puesto en el Voice Design Benchmark de Hume AI, con una puntuación general de 71,4 y un resultado de 60,8 en modelado de acentos. De acuerdo con la compañía, Flash TTS y Flash-Lite TTS ocuparon también el primer y segundo lugar, respectivamente, en el Overall Quality Index de Hume AI.
En las pruebas ciegas de preferencia de Voice Arena, ambos modelos se situaron entre los mejor evaluados para japonés, portugués de Brasil, vietnamita, árabe estándar moderno, español de México e hindi. La inclusión del español mexicano ofrece una referencia directa para usuarios y desarrolladores hispanohablantes, aunque los resultados divulgados no permiten extender esa evaluación a todas las variantes regionales del idioma.
RuntimeWire advirtió que los datos de Hume fueron comunicados por la propia Google y no bastan por sí solos para establecer una comparación definitiva. El medio también informó que Alan Cowen, exdirector ejecutivo de Hume AI y actual director de investigación científica en Google DeepMind, y Leland Rechis participaron en el lanzamiento.
La clasificación independiente Provider Voice de Artificial Analysis mostró un panorama distinto. Gemini 3.8 Flash TTS quedó segundo con un Elo de 1260 y un intervalo de confianza del 95% de ±17, mientras que Flash-Lite ocupó el sexto puesto con 1235 y un intervalo de ±16. Cartesia Sonic 3.6 lideró con 1273 puntos y 1.757 muestras, seguido por el modelo de Google. Alibaba Qwen-Audio-3.0-TTS-Plus quedó tercero con 1259, Inworld Realtime TTS-2 fue cuarto con 1245 y ElevenLabs v3 Conversational ocupó el puesto 12 con 1196 y un intervalo de ±15.
Ventaja en pronunciación, pero con una competencia ajustada
Gemini 3.8 Flash TTS alcanzó el primer lugar en el Pronunciation Robustness Benchmark de Artificial Analysis con un 89,5%, frente al 88,2% obtenido por su predecesor, Gemini 3.1 Flash TTS.
OrcaRouter subrayó que la distancia entre Gemini 3.8 Flash TTS y Qwen-Audio-3.0-TTS-Plus era de apenas un punto Elo: 1260 frente a 1259, con 1.999 y 1.447 muestras, respectivamente. Debido a la amplitud de los intervalos de confianza, consideró que los tres modelos mejor clasificados se encuentran dentro de un mismo rango competitivo.
Uso gratuito hasta finales de 2026
El nivel estándar de ambos modelos será gratuito hasta el 31 de diciembre de 2026. Desde el 1 de enero de 2027, Gemini 3.8 Flash TTS costará 1 dólar por cada millón de tokens de entrada, 18 dólares por la salida de audio y 0,25 dólares por el almacenamiento en caché de contexto. Flash-Lite mantendrá el precio de entrada en 1 dólar y cobrará 12 dólares por la salida de audio.
En la modalidad Batch & Flex, Flash TTS tendrá tarifas de entre 0,25 y 0,50 dólares por millón de tokens de entrada y entre 4,50 y 9 dólares por la salida. Flash-Lite aplicará el mismo rango de entrada y entre 3 y 6 dólares por la salida. El nivel Priority también será gratuito durante 2026; después cobrará 1,80 dólares por la entrada y 32,40 dólares por la salida en Flash TTS, frente a 1,80 y 21,60 dólares, respectivamente, en Flash-Lite.
Comentarios
Publicar un comentario