ADVERTISEMENT
LIVE-DESK·Globale Marktredaktion·Last updated 14s ago
ADVERTISEMENT
Novara — A Smarter Way to Access Global Markets
Märkte/DevisenArticle

Google launcht Gemini 3.5 Transcribe mit einer Latenz unter einer Sekunde

Das neue Sprach-zu-Text-Modell erzielt in Nicht-Streams-Modus eine Wortfehlerrate von 2,6 % und transkribert 70 % schneller als der Vorgänger. Es unterstützt 85+ Sprachen und die Identifizierung von Sprechern.

SL
Sophie Laurent · FX & Rates Desk · 30 Aug 2026 · 13:08 · 1 Min. Lesezeit
Teilen
Google launcht Gemini 3.5 Transcribe mit einer Latenz unter einer Sekunde

Google hat am Mittwoch Gemini 3.5 Transcribe vorgestellt, ein Sprach-zu-Text-Modell, das die Transkriptionsfähigkeiten in Echtzeit und in Batch-Anwendungen in Unternehmen und für Konsumenten verbessern soll.

Das Modell erreicht eine Wortfehlerrate von 2,6 % in nicht streamenden Anwendungen und von 4,0 % im Stream-Modus, was laut Artificial Analysis die früheren Chirp 3-Modell überragt. Die Verbesserungen in der Latenz sind beträchtlich, mit einem 70 % Abfall der Zeit bis zur endgültigen Transkription und einer Subsekunden-Latenz im Echtzeit-Streaming. Am Benchmark FLEURS hat das Modell Wortfehlerraten von 5,04 % für nicht streamende und 5,50 % für streamende Anwendungsfälle erreicht.

Euro / US Dollar

EURUSD
Full profile →
1.1587▲ 0.00%
As of 30/08/2026, 09:40:33

Die Gemini 3.5 Transcribe unterstützt die automatische Erkennung und Transkription von mehr als 85 Sprachen und kann bis zu drei Sprecher in vorab aufgenommener Audio mit Zeitstempeln identifizieren. Sie wandelt Audio in formatiertes Text um, verarbeitet Hintergrundgeräusche und technische Fachbegriffe und entfernt Füllwörter, während der Erkennung von Sprecherschreibfehlern und benutzerdefinierten Wortschatz ermöglicht wird.

Das Modell ist über zwei APIs erreichbar: Die Live-API für Echtzeit-Streaming über den Endpunkt `gemini-3.5-transcribe-live` sowie die Interactions-API für die Verarbeitung vorgezeichneter Audio über den Endpunkt `gemini-3.5-transcribe`, die auch die Zuordnung von Sprechern für Meetings und Anruflogfächer umfasst.

Die Integration erfolgt im gesamten Google-Ekosystem, einschliesslich der Gemini-App auf macOS, der Rambler-Funktion auf Android über Gboard und Google AI Studio. Entwickler können auf das Modell in der öffentlichen Vorschau über Google AI Studio zugreifen, während Unternehmen es über die Gemini Enterprise Agent Platform implementieren können. Eine Diktierfunktion für Chrome ist für eine zukünftige Aktualisierung geplant.

Dieser Artikel wurde mit KI-Unterstützung erstellt und von einer Finances-Review-Redakteurin bearbeitet.
ADVERTISEMENT
Artikel teilen
SL
Geschrieben von
Sophie Laurent
FX & Rates Desk

Sophie covers currency markets and central bank policy across Europe, with a focus on how rate decisions ripple through FX pairs. She has been tracking the ECB's policy path since the start of the current easing cycle.

Mehr von Sophie Laurent →
ADVERTISEMENT
ADVERTISEMENT