Gemini 3.5 transcribe: Google quiere hacer la transcripción vocal más rápida, más precisa y más inteligente

Gemini 3.5 Transcribe : Google quiere hacer la transcripción de voz más rápida, precisa e inteligente

Google mejora su tecnología de audio con Gemini 3.5 Transcribe, un nuevo modelo de conversión de voz a texto diseñado tanto para la transcripción en tiempo real como para el análisis de grabaciones largas. Su promesa es una mejor comprensión del habla natural, del ruido ambiental, de los acentos y del vocabulario especializado, mientras produce directamente un texto limpio y estructurado.

El modelo está orientado a asistente de voz, subtitulación, centros de atención al cliente, así como dictado avanzado. Sin embargo, su verdadera ambición va más allá: transformar la transcripción en una capa inteligente que pueda entender el contexto y activar otras acciones en el ecosistema de Gemini.

Dos modos para tiempo real y grabaciones

Gemini 3.5 Transcribe se presenta en dos modos distintos. El primer modo está orientado al streaming en tiempo real a través de la API en vivo, utilizando el modelo gemini-3.5-transcribe-live. Google asegura una latencia de menos de un segundo, lo que permite su uso en asistentes de voz, conversaciones interactivas y subtitulación en directo.

El segundo modo, gemini-3.5-transcribe, utiliza la API de interacciones y está dirigido a archivos ya grabados. Puede manejar reuniones, llamadas o contenidos de audio más largos, con atribución de locutores y marcas de tiempo a nivel de palabra.

Esta separación permite a Google optimizar el modelo según dos necesidades muy diferentes: responder de inmediato o producir la transcripción más precisa posible.

Gemini no solo transcribe palabras

Google busca superar el funcionamiento tradicional de conversión de voz a texto. Gemini 3.5 Transcribe es capaz de gestionar las vacilaciones y las autocorrecciones naturales. Una frase como «cita el martes… no, miércoles» puede ser interpretada directamente como la versión corregida en lugar de como una secuencia literal de palabras. El modelo también puede eliminar automáticamente muletillas como «eh» o «um» y reformatear la transcripción.

El resultado se asemeja más a un texto directamente utilizable que a un simple verbatim bruto.

Una transcripción sensible al contexto

Gemini 3.5 Transcribe también puede utilizar vocabulario personalizado. Un desarrollador puede proporcionar términos técnicos, nombres propios o grafías especiales para mejorar su reconocimiento. Esto es esencial en sectores como la medicina, la ingeniería o el soporte técnico, donde los modelos genéricos a menudo fallan en los términos más importantes.

Por lo tanto, Google apuesta por una transcripción más consciente del contexto de la aplicación.

Más de 85 lenguas compatibles

El modelo detecta automáticamente más de 85 lenguas y soporta diferentes acentos y dialectos regionales. Esta cobertura lo convierte en una solución especialmente interesante para servicios internacionales o aplicaciones de voz multilingües. Google también indica que Gemini 3.5 Transcribe puede gestionar cambios de idioma durante un mismo flujo de audio.

Por lo tanto, el modelo no necesita que el usuario establezca manualmente un idioma antes de cada conversación.

Hasta tres locutores identificados automáticamente

En grabaciones preexistentes, Gemini 3.5 Transcribe ofrece diarización, es decir, la identificación de los diferentes intervinientes. El modelo puede atribuir con precisión las intervenciones a hasta tres locutores, con marcas de tiempo asociadas. El soporte para más de tres personas ya está disponible en un formato experimental.

Esta capacidad es especialmente útil para reuniones, entrevistas o llamadas profesionales, donde una transcripción sin distinción entre los participantes rápidamente pierde gran parte de su valor.

2.6 % de tasa de error en grabaciones según Artificial Analysis

Las primeras cifras publicadas son bastante sólidas. Según las mediciones de Artificial Analysis, Gemini 3.5 Transcribe obtiene una tasa de error de palabras promedio de 4.0 % en streaming. En audio no en tiempo real, este porcentaje baja al 2.6 %. La tasa de error de palabras mide la proporción de palabras eliminadas, añadidas o reconocidas incorrectamente en relación con la transcripción de referencia. Cuanto más bajo sea el número, mejor será teóricamente la precisión.

Como siempre, estos resultados varían considerablemente según la calidad del micrófono, la lengua, los acentos o el ruido de fondo. Sin embargo, ya posicionan al modelo entre las soluciones más competitivas del mercado.

Hasta un 70 % de ahorro en el tiempo de transcripción final

Google también destaca la velocidad. Según Artificial Analysis, el tiempo necesario para obtener la transcripción final se mejoraría en aproximadamente un 70 % en comparación con Chirp 3, el modelo anterior de transcripción de Google. La diferencia puede resultar especialmente importante para los asistentes de voz.

Una transcripción muy precisa pero lenta deteriora de inmediato la fluidez de una conversación. Reducir el tiempo de finalización permite que el modelo detrás de la interfaz de voz empiece a reflexionar más temprano.

En un asistente multimodal, unos cientos de milisegundos pueden cambiar radicalmente la sensación de interacción.

Buenas actuaciones multilingües en FLEURS

gemini 3.5 audio transcribe fleu.width 1000.format webp

Google también publica resultados en el benchmark FLEURS, que prueba el reconocimiento de voz en muchos idiomas y regiones. Gemini 3.5 Transcribe alcanza una tasa de error de 5.50 % en streaming y 5.04 % fuera del streaming en la selección evaluada. Estos puntajes refuerzan, sobre todo, la idea de que Google quiere construir un modelo global en lugar de una solución principalmente optimizada para el inglés.

La empresa tiene aquí una ventaja histórica gracias a los años de desarrollo de Google Assistant, Search y de herramientas de reconocimiento de voz en Android.

Gboard recibe una nueva función Rambler

Gemini 3.5 Transcribe no se limita a las API. Google ya lo utiliza en varios de sus productos. En Android, Gboard adopta una nueva función llamada Rambler. Esta permite dictar pensamientos de manera natural, incluso con vacilaciones o repeticiones, y luego transformarlos automáticamente en texto correctamente formateado.

El usuario también puede dar instrucciones vocales para corregir un error, modificar una formulación o cambiar el estilo de escritura. La idea es transformar la dictada tradicional en un verdadero editor conversacional.

La transcripción se vuelve contextual en Antigravity

Google también integra el modelo en Antigravity. Con el permiso del usuario, Gemini puede tener en cuenta el contenido mostrado en pantalla y el historial de conversación para mejorar la transcripción. Esto se vuelve especialmente útil para nombres de archivos, documentos abiertos o ciertos términos visibles en pantalla.

Una palabra difícil de reconocer acústicamente puede ser mucho más fácil de identificar si Gemini sabe que corresponde al nombre del documento actualmente abierto. Esta combinación entre audio y contexto visual ilustra bien la ventaja de un modelo multimodal.

La versión macOS puede activar otros modelos de Gemini

En la aplicación Gemini en macOS, Gemini 3.5 Transcribe va aún más lejos. Puede transformar una dictada libre en texto, pero también utilizar comandos vocales para activar acciones. Por ejemplo, Google permite resumir archivos locales, transformar contenido entre diferentes aplicaciones o generar una imagen directamente en la ubicación del cursor.

Gemini 3.5 Transcribe puede entonces llamar a otros modelos Gemini en segundo plano. La transcripción se convierte así en un simple primer paso en una cadena de acciones mucho más compleja.

Chrome seguirá pronto

Google también planea integrar esta tecnología en Chrome. El objetivo es permitir la dictada en prácticamente cualquier campo web. Respuestas a mensajes, publicaciones, formularios o prompts Gemini podrán completarse directamente por voz. El interés radica sobre todo en la capacidad del modelo de limpiar automáticamente el lenguaje oral.

En lugar de una transcripción cruda llena de vacilaciones y correcciones, el navegador podría producir un texto cercano a lo que el usuario habría escrito por sí mismo.

Google quiere convertirse en la infraestructura de las interfaces de voz

Gemini 3.5 Transcribe también se dirige directamente a los desarrolladores. Plataformas como Agora, LangChain, LiveKit, Pipecat, Vercel, Fishjam y Vision Agents ya utilizan la Gemini Live API para construir interfaces de voz. Estos servicios abordan sobre todo las problemáticas complejas del streaming de audio en tiempo real. Así, Google busca que Gemini sea lo suficientemente simple de integrar para convertirse en una capa estándar de los futuros asistentes de voz.

La batalla ya no se libra solo por el mejor chatbot de texto, sino que se desplaza hacia la interfaz que el usuario usará para hablarle.

Es precisamente aquí donde Gemini 3.5 Transcribe cobra importancia. Los asistentes de voz anteriores a menudo se basaban en una cadena bastante rígida: reconocimiento de voz, conversión a texto, interpretación del comando y luego respuesta. Cualquier error en el primer paso degradaba todo el resto; los modelos modernos pueden hacerlo mucho mejor. Comprenden el contexto, las correcciones espontáneas y las intenciones implícitas, y luego transmiten una representación mucho más limpia a los agentes responsables de actuar.

Por lo tanto, la transcripción se convierte en menos una operación mecánica y más en un verdadero paso de comprensión.

Disponibilidad aún parcial para el gran público

Gemini 3.5 Transcribe está actualmente disponible en vista pública para desarrolladores a través de la API de Gemini en Google AI Studio y Google Antigravity. Las empresas también pueden acceder a él a través de la Gemini Enterprise Agent Platform.

Para el público en general, el despliegue es más limitado. El modelo ya se utiliza en Gemini en macOS en inglés y en Rambler en Android en algunos países y lenguas. Chrome debe seguir pronto.

Google está procediendo de forma gradual antes de una disponibilidad más amplia.

Google transforma la conversión de voz a texto en inteligencia contextual

La verdadera evolución de Gemini 3.5 Transcribe no reside únicamente en su tasa de error. Los sistemas de reconocimiento de voz ya son extremadamente eficientes desde hace varios años. Lo que ahora está cambiando es su papel. El modelo comprende las vacilaciones, utiliza el contexto de la pantalla, reconoce el vocabulario particular de una aplicación y puede llamar a otros modelos para continuar una tarea.

Así, la frontera entre la transcripción y el asistente se vuelve cada vez más difusa. Google ya no se limita a convertir la voz en texto. Busca hacer de la voz una interfaz universal capaz de controlar sus aplicaciones, agentes y, pronto, una parte mucho más amplia de la web.


Scroll al inicio