Google hat mit Gemini 3.5 Live Translate ein neues Audiomodell vorgestellt, das nahezu in Echtzeit Sprache in über 70 Sprachen übersetzt. Anders als herkömmliche Systeme wartet das Modell nicht auf Sprechpausen, sondern erzeugt kontinuierlich fließende Übersetzungen. Damit setzt der Konzern einen neuen Meilenstein in der automatischen Sprachübersetzung.
Natürliche Übersetzung in Echtzeit
Das Modell erkennt automatisch mehr als 70 Sprachen und erzeugt übersetzte Sprache, die den Tonfall, das Sprechtempo und die Stimmlage des ursprünglichen Sprechers beibehält. Besonders hervorzuheben ist die kontinuierliche Arbeitsweise: Anstatt abwechselnd zu sprechen und zu übersetzen, folgt Gemini 3.5 Live Translate dem Sprecher mit nur wenigen Sekunden Verzögerung. Dies eliminiert lästige Pausen und ermöglicht ein deutlich natürlicheres Gesprächserlebnis.
Breite Verfügbarkeit für verschiedene Zielgruppen
Der Rollout beginnt ab sofort und richtet sich an unterschiedliche Nutzergruppen. Entwickler können das Modell über die Gemini Live API und Google AI Studio im öffentlichen Preview testen. Unternehmen erhalten ab diesem Monat Zugriff auf eine private Preview in Google Meet. Für Endnutzer ist die Funktion über die Google Translate App für Android und iOS verfügbar.
Integrationen für Entwickler
Dank Streaming-Fähigkeiten verarbeitet Gemini 3.5 Live Translate Spracheingaben kontinuierlich und funktioniert auch in lauten Umgebungen zuverlässig. Plattformen wie Agora, Fishjam, LiveKit, Pipecat und Vision Agents integrieren das Modell bereits über die Gemini Live API und ermöglichen so den einfachen Aufbau von Sprachübersetzungsanwendungen. Der Fahrdienstvermittler Grab testet die Technologie bereits, um Fahrer und Reisende in Echtzeit sprachlich zu verbinden.
Positive Resonanz aus der Industrie
Erste Tests von Partnern fallen durchweg positiv aus. Unternehmen wie Grab, CJ ENM und LiveKit loben die automatische Spracherkennung, die hohe Genauigkeit und die geringe Latenz des Modells. Besonders die Fähigkeit, verschiedene Sprachen ohne manuelle Konfiguration zu erkennen und fließend zu übersetzen, wird als Meilenstein hervorgehoben.
Neue Funktionen in Google Meet und der Translate-App
In Google Meet wird die Sprachübersetzung bald auf über 70 Sprachen und mehr als 2.000 Sprachkombinationen erweitert. Bisher war die Funktion auf fünf Sprachen und Übersetzungen zu und vom Englischen beschränkt.
In der Google Translate App ermöglicht der Kopfhörer-Modus eine nahtlose Übersetzung, die den Tonfall des Sprechers widerspiegelt. Für Android-Nutzer kommt zusätzlich ein neuer Listening Mode hinzu: Das Telefon kann wie bei einem Telefonat ans Ohr gehalten werden, wobei die übersetzte Audioausgabe direkt über den Hörer erfolgt.
Sicherheit durch SynthID
Alle vom Modell erzeugten Audiodateien erhalten ein mit SynthID eingebettetes Wasserzeichen. Dieses nicht wahrnehmbare Merkmal soll die Herkunft KI-generierter Inhalte nachweisbar machen und so der Verbreitung von Fehlinformationen entgegenwirken.
Quelle: DeepMind Blog