El miércoles, Google presentó Gemini 3.5 Transcribe, un modelo de voz a texto diseñado para mejorar las capacidades de transcripción en tiempo real y por lotes en aplicaciones empresariales y de consumo.
El modelo ofrece una tasa de error de palabras del 2,6 % en aplicaciones sin transmisión continua y del 4,0 % en modo de transmisión, según Artificial Analysis, lo que supera al anterior modelo Chirp 3. Las mejoras en la latencia son sustanciales, con una reducción del 70 % en el tiempo hasta la transcripción final y una latencia de transmisión en tiempo real inferior a un segundo. En la prueba de referencia FLEURS, el modelo registró tasas de error de palabras del 5,04 % para el uso continuo y del 5,50 % para los escenarios de transmisión.
Gemini 3.5 Transcribe admite la detección y transcripción automáticas de más de 85 idiomas y puede identificar hasta a tres hablantes en audios previamente grabados con marcadores de tiempo. Procesa el audio en texto formateado, gestiona el ruido de fondo y la terminología técnica, y elimina las palabras de relleno mientras permite las correcciones de los hablantes y el reconocimiento de vocabulario personalizado.
El modelo está accesible a través de dos API: la API en directo para transmisión en tiempo real utilizando el punto de acceso `gemini-3.5-transcribe-live` y la API de interacciones para el procesamiento de audio previamente grabado a través del punto de acceso `gemini-3.5-transcribe`, que incluye la asignación de hablantes para las reuniones y los registros de llamadas.
La integración está en curso en todo el ecosistema de Google, incluida la aplicación Gemini en macOS, la función Rambler en Android a través de Gboard y Google AI Studio. Los desarrolladores pueden acceder al modelo en la versión de previsualización pública a través de Google AI Studio, mientras que las empresas pueden implantarlo a través de la plataforma Gemini Enterprise Agent. Se tiene previsto incorporar una función de dictado en Chrome en una actualización futura.













