Google d'Alphabet a lancé mercredi Gemini 3.5 Transcribe, un modèle de conversion voix en texte conçu pour la transcription en temps réel avec une latence inférieure à une seconde et une précision améliorée par rapport à son prédécesseur, Chirp 3.
Le nouveau modèle permet de réduire de 70 % le temps nécessaire à la transcription finale par rapport à Chirp 3, tout en maintenant un taux d'erreurs lors de la lecture en flux de 4,0 % et un taux hors flux de 2,6 %, selon Artificial Analysis. Lors des tests de performance sur l'ensemble FLEURS, il a enregistré un taux d'erreur lors de la lecture en flux de 5,50 % et un taux hors flux de 5,04 %.
Gemini 3.5 Transcribe est accessible par l'intermédiaire de deux interfaces API : l'API Live pour le streaming en temps réel, avec une latence inférieure à une seconde, et l'API Interactions pour les enregistrements audio pré-enregistrés, comme les réunions et les journaux d'appels. Cette dernière inclut l'identification des intervenants pour jusqu'à trois voix, avec des transcriptions timestampées.
Le modèle prend en charge la détection automatique de la langue dans plus de 85 langues et comporte des fonctionnalités telles que la suppression des mots de remplissage, la formulation automatique du texte et la reconnaissance de vocabulaire personnalisé pour la terminologie spécialisée. Il est en phase de prévisualisation publique pour les développeurs via Google AI Studio et pour les entreprises via la plate-forme Gemini Enterprise Agent.
Google envisage d'intégrer cette technologie dans l'application Gemini sur macOS, la fonctionnalité Rambler sur Android via Gboard et une future mise à jour de l'outil de dictée intégré à Chrome. La société n'a pas communiqué de prix ni de calendrier de disponibilité commerciale.












