Google a présenté mercredi Gemini 3.5 Transcribe, un modèle de transcription des conversations en texte, conçu pour améliorer les capacités de transcription en temps réel et en batch dans les applications destinées aux entreprises et aux consommateurs.
Selon Artificial Analysis, le modèle présente un taux d'erreur de mots de 2,6 % dans les applications non en flux et 4,0 % en mode continu, ce qui le place au-dessus du modèle précédent, Chirp 3. Les améliorations de la latence sont importantes, avec une réduction de 70 % du temps nécessaire à la transcription finale et une latence de diffusion en temps réel inférieure à une seconde. Sur le banc d'essai FLEURS, le modèle a enregistré des taux d'erreur de mots de 5,04 % pour les cas d'utilisation non en flux et de 5,50 % en mode continu.
Gemini 3.5 Transcribe prend en charge la détection et la transcription automatiques de plus de 85 langues et peut identifier jusqu'à trois intervenants dans des fichiers audio pré-enregistrés avec des timestamps. Elle transforme l'audio en texte structuré, gère le bruit de fond et la terminologie technique, et supprime les mots vides tout en permettant les corrections des intervenants et la reconnaissance de mots du vocabulaire personnalisé.
Le modèle est accessible via deux API : l'API Live pour le streaming en temps réel en utilisant l'extranet `gemini-3.5-transcribe-live`, et l'API Interactions pour le traitement d'audio préenregistré via l'extranet `gemini-3.5-transcribe`, qui comprend l'attribution des orateurs pour les réunions et les rapports d'appels.
L'intégration s'impose dans l'écosystème de Google, notamment avec l'application Gemini sur macOS, la fonction Rambler sur Android via Gboard, et Google AI Studio. Les développeurs peuvent accéder au modèle en version prévisionnelle via Google AI Studio, tandis que les entreprises peuvent le déployer via la plate-forme Gemini Enterprise Agent. Une fonction de dictée est prévue pour Chrome dans une prochaine mise à jour.












