Mercredi, Google a présenté Gemini 3.5 Transcribe, un modèle de reconnaissance vocale destinée à la transcription en temps réel, avec une précision et une latence améliorées.
Selon les benchmarks d'Analyse artificielle, le modèle atteint un taux d'erreurs de 4,0 % dans les applications de flux et un taux de 2,6 % dans les cas non liés au flux. Comparé au modèle Chirp 3 précédent, il réduit le temps nécessaire à la transcription finale de 70 %. Sur le benchmark FLEURS, le modèle enregistre un taux d'erreurs de 5,50 % en mode de flux et 5,04 % dans les cas d'utilisation non liés au flux.
Gemini 3.5 Transcribe propose deux modes d'exploitation. L'API Live offre une latence inférieure à une seconde pour le streaming en direct via l'identifiant `gemini-3.5-transcribe-live`, tandis que l'API Interactions traite l'audio pré-enregistré, tels que les réunions et les registres d'appels, avec attribution des intervenants, à l'aide de l'identifiant `gemini-3.5-transcribe`.
Le modèle prend en charge la transcription automatique en plus de 85 langues et peut identifier jusqu'à trois intervenants dans des contenus préenregistrés avec des timestamps. D'autres fonctions comprennent la suppression du bruit de fond, la gestion de la terminologie technique, la suppression des mots de remplissage, la mise en forme automatique du texte et la reconnaissance de vocabulaire personnalisé pour les termes spécialisés.
L'intégration des produits comprend l'application Gemini sur macOS, la fonction Rambler sur Android via Gboard et Google AI Studio. Le modèle entre en version publique de prévision pour les développeurs via Google AI Studio et pour les entreprises via la plateforme Gemini Enterprise Agent. Chrome devrait recevoir des capacités de dictée dans une mise à jour à venir.













