El miércoles, Alphabet presentó Google Gemini 3.5 Transcribe, un modelo de voz a texto diseñado para la transcripción en tiempo real con latencia de menos de un segundo y una mejora de la precisión respecto a su predecesor, Chirp 3.
El nuevo modelo reduce el tiempo hasta la transcripción final en un 70% en comparación con Chirp 3, al tiempo que mantiene una tasa de errores de palabra en transmisión del 4,0% y una tasa fuera de transmisión del 2,6%, según Artificial Analysis. En las pruebas de benchmark en el conjunto de datos FLEURS, registró una tasa de error en transmisión del 5,50% y una tasa fuera de transmisión del 5,04%.
Gemini 3.5 Transcribe está disponible a través de dos interfaces de API: la API en vivo para streaming en tiempo real con una latencia de menos de un segundo, y la API de Interacciones para audio grabado previamente, como reuniones y registros de llamadas. Esta última incluye identificación de oradores para hasta tres voces con transcripciones con tiempo de registro.
El modelo admite la detección automática del idioma en más de 85 lenguas e incorpora funciones como la eliminación de palabras de relleno, la formateado automático del texto y el reconocimiento de vocabulario personalizado para la terminología especializada. Está entrando en previsualización pública para desarrolladores a través del Google AI Studio y para empresas a través de la plataforma Gemini Enterprise Agent.
Google tiene previsto integrar la tecnología en la aplicación Gemini en macOS, la función Rambler en Android a través de Gboard y en una futura actualización de la herramienta de dictado incorporada de Chrome. La compañía no ha revelado los precios ni los plazos de disponibilidad comercial.












