OpenAI hat mit GPT-Live sein drittes Generationssystem für Sprach-KI vorgestellt, das die Art und Weise, wie Menschen mit künstlicher Intelligenz kommunizieren, grundlegend verändern soll. Das neue Modell arbeitet im Full-Duplex-Betrieb und kann daher gleichzeitig zuhören und sprechen. Im Gegensatz zu älteren Systemen entfällt die verzögernde Rundensteuerung vollständig. Im folgenden Artikel erfahren Sie, welche technischen Innovationen hinter der beispiellos natürlichen Konversation stecken.
Von Turn-based Systemen zu kontinuierlichem Streaming
Frühere Spracharchitekturen übernahmen das rundenbasierte Prinzip von Textmodellen. Jede Äußerung wurde als diskreter Audio-Datensatz verarbeitet, wobei Spracherkennung, Sprachverarbeitung und Sprachsynthese nacheinander ausgeführt wurden. Diese Kaskadierung führte zu spürbaren Latenzen und ignorierte nuancierte Signale wie Tonfall oder Gesprächstempo.
Sprache-zu-Sprache-Modelle verbesserten diesen Ansatz, da sie Audio direkt verarbeiten konnten. Dennoch blieb ein Turn-Detektor im Pfad, der entscheiden musste, wann die Verarbeitung beginnen durfte. GPT-Live entfernt diesen Engpass vollständig und übergibt die Gesprächskontrolle direkt an das Sprachmodell.
Die Architektur von GPT-Live im Detail
Strikte Trennung von Medienfluss und Anwendungslogik
Ein zentraler Entwicklungsschritt war die Isolierung des Medienpfads von der Anwendungslogik. Audio bewegt sich zwischen Client und Modell auf einem dedizierten Fast Path, während Delegation, Werkzeugnutzung und Backend-Prozesse asynchron über RPC-Schnittstellen erfolgen. Eine langsame Tool-Antwort blockiert somit niemals den Audioausgang.
Die Medienkomponenten wurden in Go neu geschrieben und ersetzen eine frühere Python-asyncio-Lösung. Diese Änderung verbesserte die Frame-Lieferung drastisch. WebRTC bildet das Transportfundament und gleicht Paketverluste sowie Verbindungswechsel aus.
Zustandsbehaftete Inferenz nahtlos im Hintergrund
Da Sprachsitzungen lange aktiv bleiben, wächst der Gesprächskontext kontinuierlich an. GPT-Live verwendet ein nahtloses Handover-Verfahren zwischen Modellinstanzen. Eine Ersatzinstanz wird vorgewärmt, mit dem aktuellen Kontext vorbefüllt und parallel betrieben, bevor der Wechsel erfolgt.
Überschreitet der Kontext das Limit, kommt die Kontextkompaktierung zum Einsatz. Da dies den KV-Cache invalidiert, bereitet das System eine neue Instanz mit dem kompaktierten Kontext vor, während die laufende Sitzung weiterläuft. So bleibt das Gespräch auch bei längsten Calls unterbrechungsfrei.
Delegation an Frontier-Modelle ohne Verzögerung
GPT-Live greift für komplexe Reasoning-Aufgaben auf leistungsfähigere Modelle wie GPT-5.5 zurück. Um Latenzen zu minimieren, erstellt der Server bereits beim Sitzungsstart eine Inferenzsitzung für das Frontier-Modell und befüllt sie mit dem initialen Kontext. Durch Session Affinity und Prompt Caching bleiben nachfolgende Delegationen schnell.
Gleichzeitig zerlegt der Anwendungsserver den kontinuierlichen Audiofluss in diskrete Nachrichten für die Benutzeroberfläche und Analysewerkzeuge. Anhand partieller Transkripte und Zeitsignale wird erkannt, wer gerade spricht. Kurze Bestätigungen wie mm hmm werden dabei nicht als eigene Nachricht gewertet, während inhaltliche Einschübe separat erscheinen.
WARP und Instant Connect beschleunigen den Start
Bisher erforderte der Aufbau einer Sprachverbindung mehrere Protokoll-Handshakes. OpenAI entwickelte das WebRTC Abridged Roundtrip Protocol (WARP), das den Start von sechs auf nur einen Netzwerk-Roundtrip reduziert. Zusammen mit Instant Connect, das SDP-Parameter vorausverhandelt, ist ein Sitzungsbeginn mit einem einzigen UDP-Paket möglich.
Diese Optimierungen sind als offene Spezifikationen konzipiert und werden über die IETF vorangetrieben. Unterstützung wurde bereits in libwebrtc und Pion integriert.
Tests unter realen Produktionsbedingungen
Vor dem Livegang führte OpenAI stille Paralleltests durch. Produktions-Sitzungen wurden zusätzlich an GPT-Live geleitet, ohne dass Nutzer dies bemerkten. Dabei zeigte sich, dass die Kapazitätsplanung nicht allein auf GPU-Durchsatz ausgerichtet sein darf. Sprachsitzungen beanspruchen kontinuierlich CPU-seitige Handler und Netzwerkpfade.
Zudem erwies sich die geografische Nähe der Inferenz als entscheidend. Lang laufende Sitzungen brachten Speicherdruck und Wiederherstellungsroutinen ans Licht, die in kurzen Laborlasttests nicht auffallen. Die Tests führten zu granularerer Telemetrie und verbesserten Rollout-Kontrollen.
Ausblick: Die Zukunft der Echtzeit-Voice AI
Mit GPT-Live demonstriert OpenAI, dass flüssige Echtzeit-Sprachinteraktion auf globaler Skala machbar ist. Die Kombination aus Full-Duplex-Streaming, separierten Medienpfaden, asynchroner Delegation und optimiertem Transportprotokoll schafft ein Fundament für kommende Anwendungen. Das System unterstützt bereits ChatGPT Voice und wird die Basis für die anstehende GPT-Live API sowie agentenbasierte Steuerung bilden.
Quelle: OpenAI Blog