ADVERTISEMENT
REDACCIÓN EN VIVO·Redacción de mercados globales·Last updated 14s ago
ADVERTISEMENT
Mercados/ForexArticle

Google lanza Gemini 3.5 Transcribe con latencia de subsegundo

El nuevo modelo de reconocimiento de voz a texto alcanza una tasa de error de palabras del 2,6 % en modo no en tiempo real y una transcripción un 70 % más rápida que el modelo anterior. Admite más de 85 idiomas y la identificación de hablantes.

SL
Sophie Laurent · FX & Rates Desk · 30 Aug 2026 · 13:08 · 1 min de lectura
Compartir
Google lanza Gemini 3.5 Transcribe con latencia de subsegundo

El miércoles, Google presentó Gemini 3.5 Transcribe, un modelo de voz a texto diseñado para mejorar las capacidades de transcripción en tiempo real y por lotes en aplicaciones empresariales y de consumo.

El modelo ofrece una tasa de error de palabras del 2,6 % en aplicaciones sin transmisión continua y del 4,0 % en modo de transmisión, según Artificial Analysis, lo que supera al anterior modelo Chirp 3. Las mejoras en la latencia son sustanciales, con una reducción del 70 % en el tiempo hasta la transcripción final y una latencia de transmisión en tiempo real inferior a un segundo. En la prueba de referencia FLEURS, el modelo registró tasas de error de palabras del 5,04 % para el uso continuo y del 5,50 % para los escenarios de transmisión.

Euro / US Dollar

EURUSD
Full profile →
1.1587▲ 0.00%
As of 30/08/2026, 09:40:33

Gemini 3.5 Transcribe admite la detección y transcripción automáticas de más de 85 idiomas y puede identificar hasta a tres hablantes en audios previamente grabados con marcadores de tiempo. Procesa el audio en texto formateado, gestiona el ruido de fondo y la terminología técnica, y elimina las palabras de relleno mientras permite las correcciones de los hablantes y el reconocimiento de vocabulario personalizado.

El modelo está accesible a través de dos API: la API en directo para transmisión en tiempo real utilizando el punto de acceso `gemini-3.5-transcribe-live` y la API de interacciones para el procesamiento de audio previamente grabado a través del punto de acceso `gemini-3.5-transcribe`, que incluye la asignación de hablantes para las reuniones y los registros de llamadas.

La integración está en curso en todo el ecosistema de Google, incluida la aplicación Gemini en macOS, la función Rambler en Android a través de Gboard y Google AI Studio. Los desarrolladores pueden acceder al modelo en la versión de previsualización pública a través de Google AI Studio, mientras que las empresas pueden implantarlo a través de la plataforma Gemini Enterprise Agent. Se tiene previsto incorporar una función de dictado en Chrome en una actualización futura.

Este artículo fue producido con asistencia de IA y editado por un periodista de Finance Review Daily.
ADVERTISEMENT
Compartir esta noticia
SL
Escrito por
Sophie Laurent
FX & Rates Desk

Sophie covers currency markets and central bank policy across Europe, with a focus on how rate decisions ripple through FX pairs. She has been tracking the ECB's policy path since the start of the current easing cycle.

Más de Sophie Laurent →
ADVERTISEMENT
ADVERTISEMENT