Google DeepMind hat mit SL2T ein bahnbrechendes Modell zur Gebärdensprachen-Übersetzung vorgestellt, das erstmals direkt auf Consumer-Geräten zum Einsatz kommt. Die KI-gestützte Technologie ermöglicht es gehörlosen und hörgeschädigten Nutzern, sich auf ihrem Smartphone in Gebärdensprache zu verständigen. Damit wird ein lange überfälliger Schritt in Richtung digitaler Barrierefreiheit möglich.
Warum Gebärdensprachen eine besondere Herausforderung für KI sind
Während Künstliche Intelligenz die Verarbeitung gesprochener Sprachen in den letzten Jahrzehnten massiv vorangebracht hat, blieb die Welt der über 200 Gebärdensprachen lange außen vor. Schätzungsweise 70 Millionen gehörlose und hörgeschädigte Menschen nutzen diese Sprachen als primäres Kommunikationsmittel. Gebärdensprachen sind eigenständige, natürliche Sprachen mit eigenen Grammatiken und Vokabularen, die sich fundamental von gesprochenen Sprachen unterscheiden.
Die Übersetzung von Gebärdensprache stellt die Forschung vor zwei zentrale Hürden. Zum einen müssen komplexe visuelle Bewegungen erfasst werden, die gleichzeitig Hände, Arme, Oberkörper, Kopf und Mimik einbeziehen. Zum anderen handelt es sich nicht um eine simple Wort-für-Wort-Umsetzung, sondern um eine echte maschinelle Übersetzung zwischen zwei unterschiedlichen Sprachsystemen. Frühe Ansätze wie Übersetzungshandschuhe scheiterten genau an dieser Komplexität, da Gebärdensprache eben nicht nur Englisch mit den Händen ist.
SL2T: So funktioniert die neue Gebärdensprache KI
Das neue Modell Sign-Language-to-Text (SL2T) wurde auf Basis über 100.000 Stunden Trainingsdaten aus mehr als 50 Gebärdensprachen entwickelt. Etwa ein Viertel der Daten stammt aus der Amerikanischen Gebärdensprache (ASL). Durch das gemeinsame Training mit diversen Sprachen, Dialekten und Kompetenzstufen erlernt das System gemeinsame zugrundeliegende Strukturen und übertrifft laut Google DeepMind die Leistung einsprachiger Modelle deutlich.
Ein besonderer Fokus lag auf dem Datenschutz: Statt Rohvideodaten zu übertragen, analysiert ein lokales On-Device-Modell nur die geometrischen Koordinaten sogenannter Pose-Landmarks. Diese Landmark-Daten werden verschlüsselt an die Server gesendet, während das Originalvideo sofort gelöscht wird. So bleibt die Privatsphäre der Nutzer gewahrt.
Direkte Übersetzung ohne Zwischenschritte
Bisherige Ansätze nutzten oft sogenannte Glossen als Zwischenstufe zwischen Gebärde und Text. Diese Methode erreicht jedoch an ihre Grenzen, wenn es um non-manuelle Marker oder räumliche Konstruktionen geht. SL2T übersetzt die Koordinatensequenz der Landmarks direkt in Text und umgeht damit künstliche Vokabulargrenzen. Die Übersetzungsqualität skaliert so direkt mit der Menge der verfügbaren Daten.
In Benchmarks wie FLEURS-ASL erzielt das Modell laut Hersteller bemerkenswerte 70 BLEURT im Zero-Shot-Setting. Das Team optimierte das System jedoch nicht nur auf akademische Kennzahlen, sondern auch auf praktische Alltagstauglichkeit. Dazu gehören die Minimierung von Streaming-Verzögerungen, die Vermeidung von Halluzinationen bei Nicht-Gebärden-Eingaben sowie die Berücksichtigung von Linkshändern und einhändiger Kommunikation.
Gemeinsam mit der Gehörlose Community entwickelt
Bei dem Projekt stand die Partizipation der gehörlosen Community im Vordergrund. Von der ersten Konzeption durch den gehörlosen Google-Mitarbeiter Sam Sepah über die Datenerhebung mit gehörlosen Partnern bis hin zu Nutzerstudien und Impact-Bewertungen wurden Deaf-Perspektiven in jede Phase integriert.
Um eine verantwortungsvolle Bereitstellung zu gewährleisten, gründete Google DeepMind das AI Sign Language Advisory Committee (AISLAC). Das Gremium vereint globale Organisationen und Experten der Gehörlosenkultur und ermöglicht so eine partizipative Governance. Gemeinsam wurde ein Impact-Bericht veröffentlicht, der Fähigkeiten und aktuelle Grenzen der Technologie transparent darlegt.
Erste praktische Anwendung auf dem Pixel 11
Erstmals kommt die Gebärdensprache KI nun in Consumer-Produkten zum Einsatz. Nutzer des Pixel 11 können SL2T in Gboard und Live Transcribe nutzen, um in ASL zu tippen, zu suchen, Nachrichten zu verfassen oder Anfragen an Gemini zu stellen. In Live Transcribe ermöglicht die Funktion zudem, Gesprächsbeiträge direkt in Gebärdensprache zu formulieren, anstatt mühsam hin- und herzutippen.
Testerinnen und Tester berichten, dass das Signieren in ASL deutlich schneller, natürlicher und angenehmer sei als das Tippen in englischer Sprache. Weitere Geräte und Sprachen sollen in Kürze folgen, wobei die Nutzung für alle Anwender kostenlos bleibt.
Ausblick auf eine inklusive digitale Zukunft
Mit SL2T legt Google DeepMind den Grundstein für eine umfassendere digitale Teilhabe. Das Team arbeitet bereits an der Erweiterung auf weitere Gebärdensprachen, an der Generierung von Gebärdensprachen aus Text sowie an neuen KI-Fähigkeiten. Das langfristige Ziel bleibt die vollständige Parität zwischen gesprochenen, geschriebenen und gebärdeten Sprachen im digitalen Raum.
Quelle: Google DeepMind Blog