Gemini 3.5 Transcribe: Googles neue KI für intelligente Spracherkennung

AI generated

Google erweitert sein Portfolio um Gemini 3.5 Transcribe, ein fortschrittliches Spracherkennungsmodell, das die Schwächen klassischer Speech-to-Text-Systeme überwindet. Statt sich mit Hintergrundgeräuschen oder Fachjargon zu schwertun, wandelt die KI Rohaudio direkt in präzise, formatierte Texte um. Entwickler und Endanwender profitieren gleichermaßen von geringer Latenz und intelligenten Bearbeitungsfunktionen. Wie das Modell funktioniert und wo es bereits zum Einsatz kommt, lesen Sie im folgenden Artikel.

Gemini 3.5 Transcribe: Funktionen und APIs

Die Entwickler Diego Melendo Casado und Luke Leonhard stellen Gemini 3.5 Transcribe als präzisestes Speech-to-Text-Modell des Unternehmens vor. Es richtet sich gezielt an intelligente Sprachinteraktionen und arbeitet auch in lauten Umgebungen deutlich zuverlässiger als herkömmliche Lösungen.

Echtzeit-Streaming mit der Live API

Für interaktive Sprachanwendungen bietet Google die Live API an. Sie ermöglicht bidirektionales Echtzeit-Streaming mit einer Latenz von unter einer Sekunde. Entwickler können damit sprachgesteuerte Anwendungen bauen, die nahezu ohne Verzögerung auf Nutzereingaben reagieren.

Transkription aufgezeichneter Inhalte

Für Meetings, Anrufprotokolle und andere Aufzeichnungen steht die Interactions API bereit. Neben der reinen Umwandlung von Audio in Text liefert sie Sprecherzuordnungen und Zeitstempel auf Wortebene. Das erleichtert die nachträgliche Analyse längerer Gespräche erheblich.

Technische Highlights messen sich am Benchmark

Gemini 3.5 Transcribe erfasst natürliche Sprechweisen und erkennt individuelles Vokabular, um die Absicht des Nutzers besser zu verstehen. Die wichtigsten Funktionen umfassen die automatische Bereinigung von Füllwörtern, die Formatierung von Texten und die nahtlose Korrektur von Selbstkorrekturen während des Sprechens.

Präzision und Mehrsprachigkeit

Laut Artificial Analysis erreicht das Modell eine durchschnittliche Word Error Rate von 4,0 Prozent im Streaming und 2,6 Prozent bei nicht-streaming Anwendungen. Es unterstützt über 85 Sprachen, erkennt regionale Akzente und identifiziert in aufgezeichneten Dateien bis zu drei Sprecher zeitgleich. Zusätzlich können Entwickler spezialisierte Begriffe über ein Custom Vocabulary hinterlegen.

Leistungszuwachs gegenüber Chirp 3

Im Vergleich zum Vorgänger Chirp 3 verbessert sich die Latenz um 70 Prozent. Auf dem FLEURS-Benchmark erzielt Gemini 3.5 Transcribe eine Word Error Rate von 5,50 Prozent im Streaming und 5,04 Prozent bei nicht-streaming Szenarien über mehrere Top-Sprachen hinweg.

Nahtlose Integration in Googles Ökosystem

Über die reine API-Nutzung hinaus integriert Google das Modell tief in eigene Produkte. Auf Android nutzt die Gboard-Tastatur mit der Funktion Rambler die Technologie, um gesprochene Gedanken in gut formatierte Texte zu verwandeln. Nutzer können per Sprachbefehl Stil oder Rechtschreibung anpassen.

macOS, AI Studio und Chrome

In Google Antigravity fließen Bildschirmkontext und Chat-Verlauf ein, um die Erkennung von Dateinamen und Dokumenten präziser zu gestalten. Nutzer der Gemini App unter macOS steuern über Sprachbefehle komplexe Workflows, fassen lokale Dateien zusammen oder generieren Bilder. In Google AI Studio profitieren Entwickler von der Möglichkeit, Apps per Spracheingabe zu steuern. Für Chrome kündigt Google an, dass demnächst jedes Webfeld per Spracheingabe bedienbar sein wird.

Positive Resonanz aus der Entwickler-Community

Plattformen wie Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents nutzen bereits die Gemini Live API, um leistungsstarke sprachgesteuerte Schnittstellen zu realisieren. Unternehmen wie Vivo, Intellitek Health und Lingopal bestätigen die hohe Genauigkeit, geringe Latenz und umfassende Sprachunterstützung des Modells.

Verfügbarkeit und Ausblick

Für Entwickler befindet sich Gemini 3.5 Transcribe aktuell in der öffentlichen Vorschau über Google AI Studio und Google Antigravity. Enterprise-Kunden greifen über die Gemini Enterprise Agent Platform auf das Modell zu. Endverbraucher nutzen die Funktion bereits in der Gemini App für macOS auf Englisch sowie über Rambler auf Android in ausgewählten Ländern. Eine Integration in Chrome folgt in Kürze.

Mit Gemini 3.5 Transcribe setzt Google neue Maßstäbe in der automatischen Spracherkennung und schafft eine solide Basis für die nächste Generation sprachgesteuerter Anwendungen.

Quelle: https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe/

Dieser Inhalt wurde mithilfe künstlicher Intelligenz erstellt.
Becker Julian