Google stellt Gemini 3.8 Live vor: Neue KI-Sprachmodelle für natürliche Dialoge

AI generated

Google hat mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zwei neue Sprachmodelle vorgestellt, die KI-gestützte Gespräche natürlicher und intelligenter machen als je zuvor. Die Modelle kombinieren fortschrittliches Reasoning mit nahezu echtzeitfähiger Verarbeitung und ermöglichen so komplexe Aufgaben per Sprachbefehl. Ob für Entwickler, Unternehmen oder Endnutzer – die neue Technologie verspricht eine deutlich intuitivere Interaktion mit künstlicher Intelligenz. Erfahren Sie im Folgenden, welche Funktionen die Modelle bieten und wo Sie sie bereits nutzen können.

Natürliche Sprachinteraktion auf neuem Niveau

Google präsentiert mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking die bisher fortschrittlichsten Modelle für Live-Dialoge. Die Kerninnovation liegt in der Kombination aus parallelem Reasoning und konversationeller Intelligenz, die eine flüssige Zusammenarbeit per Sprache ermöglicht.

Die Modelle verstehen komplexe Anfragen, verarbeiten visuelle Kontexte in Echtzeit und führen Aufgaben im Hintergrund aus – ohne die Unterhaltung zu unterbrechen. Dadurch fühlt sich die Interaktion mit künstlicher Intelligenz deutlich natürlicher und produktiver an.

Zwei Modelle für unterschiedliche Anforderungen

Gemini 3.8 Live: Effizienz und Skalierbarkeit

Diese Variante wurde für Skalierbarkeit und Kosteneffizienz optimiert. Sie vereint konversationelle Intelligenz mit flüssigem Dialog und visuellem Grundverständnis. Entwickler und Unternehmen erhalten hier ein leistungsstarkes Werkzeug für produktionsreife Sprachagenten.

Nutzer schätzen das Modell besonders für seine ausgewogene Balance aus Performance und Effizienz. In der Speech Agent Arena sicherte sich Gemini 3.8 Live einen hervorragenden zweiten Platz – bei gleichzeitig hoher Kosteneffizienz im Vergleich zu anderen führenden Modellen.

Gemini 3.8 Live Extended Thinking: Komplexes Reasoning

Für anspruchsvolle Aufgaben steht die erweiterte Denkversion zur Verfügung. Sie beherrscht intelligentes Mehrschritt-Reasoning und überzeugt bei komplexen Workflows. Das Modell erreichte den ersten Platz im Artificial Analysis Speech to Speech Quality Index mit einer Bewertung von 82,6.

Besonders beeindruckend sind die Ergebnisse bei agentischen Aufgaben: 68,6 Prozent auf dem τ-Voice-Benchmark und 35,1 Prozent auf der Sierra τ-Voice-Banking-Skala. Auch beim Big Bench Audio-Test zeigt es herausragende Leistungen mit 97,7 Prozent.

Praktische Funktionen im Überblick

Visuelle Verarbeitung und Sprachwechsel

Gemini 3.8 Live verarbeitet visuelle Eingaben nahezu in Echtzeit und bereichert Gespräche damit um wertvollen Kontext. Das System erkennt automatisch 97 unterstützte Sprachen und wechselt nahtlos während eines Gesprächs zwischen ihnen.

Hintergrundprozesse und transparente Kommunikation

Tools und API-Aufrufe werden im Hintergrund ausgeführt, während das Gespräch fortgesetzt wird. Bei komplexen Anfragen nutzt Extended Thinking frühzeitige verbale Hinweise wie Lassen Sie mich das prüfen… und gibt Live-Fortschrittsberichte – für eine unterbrechungsfreie, natürliche Kommunikation.

Einsatzmöglichkeiten für Entwickler und Unternehmen

Über die Gemini Live API können Entwickler Sprachanwendungen mit Plattformen wie LangChain, LiveKit, Vercel oder Agora realisieren. Diese übernehmen die technische Infrastruktur für Echtzeit-Medienstreaming, während sich Entwickler auf das Nutzererlebnis konzentrieren.

Führende Unternehmen wie Salesforce und Genspark setzen bereits auf die neue Technologie. Besonders überzeugend sind dabei die niedrige Latenz, die hohe Flüssigkeit und die zuverlässigen Tool-Calling-Fähigkeiten der Modelle.

Sicherheit durch SynthID-Wasserzeichen

Google setzt auf Transparenz bei KI-generierten Inhalten. Alle Audioausgaben der Modelle tragen ein mit SynthID eingebettetes Wasserzeichen. Dieses ist für das menschliche Ohr nicht wahrnehmbar, ermöglicht aber eine zuverlässige Erkennung KI-generierter Inhalte und hilft so, Fehlinformationen zu verhindern.

Weitere Details zu Sicherheitsaspekten finden sich im offiziellen Model Card von Google DeepMind.

Verfügbarkeit und erste Schritte

Der Rollout startet ab sofort. Gemini 3.8 Live ist für Entwickler über die Gemini API und Google AI Studio verfügbar, für Unternehmen in einer Private Preview über Gemini Enterprise und für alle Nutzer in der Google-Suche integriert.

Gemini 3.8 Live Extended Thinking steht ebenfalls über API und AI Studio bereit. Für Unternehmen gibt es eine Preview in Gemini Enterprise, während Endnutzer mit Google AI Pro und Ultra die Funktion in Google Workspace Apps wie Docs, Gmail und Keep nutzen können.

Quelle: https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/

Dieser Inhalt wurde mithilfe künstlicher Intelligenz erstellt.
Becker Julian