OpenAI hat die Ergebnisse interner Evaluierungen zum kommenden KI-Modell Astra veröffentlicht. Die Tests deuten auf signifikante Fortschritte im Bereich agentischer Programmierung und Cybersicherheit hin. Experten schließen nicht aus, dass das System die Schwelle für kritische Cyber-Fähigkeiten erreicht hat. Was das für die digitale Sicherheit bedeutet und welche Konsequenzen das Unternehmen zieht, erfahren Sie im folgenden Artikel.
Was sind kritische Cyber-Fähigkeiten?
Unter dem eigenen Preparedness Framework von OpenAI gilt ein Modell als kritisch einzustufen, wenn es in der Lage ist, Zero-Day-Exploits in gehärteten realen Systemen zu identifizieren und zu entwickeln. Dies muss ohne menschliches Zutun über alle Schweregrade hinweg erfolgen. Alternativ reicht auch die Fähigkeit, neue Ende-zu-Ende-Angriffsstrategien gegen hochgesicherte Ziele zu entwerfen und auszuführen.
Die vorläufigen Evaluierungen von Astra zeigen eine Leistungsstärke, die es den Forschern nicht erlaubt, das Erreichen dieser kritischen Fähigkeitsstufe auszuschließen. Das Unternehmen betont ausdrücklich, dass Astra bei den jüngsten Vorfällen bei Hugging Face keine Rolle spielte.
Verstärkte Sicherheitsmaßnahmen und Kontrollen
Angesichts der Ergebnisse hat OpenAI umgehend verstärkte Sicherheitskontrollen angekündigt. Das Unternehmen arbeitet daran, Testumgebungen strenger zu isolieren und den Zugang zu Netzwerken sowie Werkzeugen zu beschränken. Zusätzlich werden Modelle durch verbesserte Verschlüsselung besser geschützt.
Intern werden alle Aktivitäten mit Astra unterbrochen, die die neuen Sicherheitsanforderungen noch nicht erfüllen. Überdies wurde ein universelles Monitoring für riskantes Verhalten eingeführt. Die Überwachungssysteme analysieren die Chain of Thought des Modells und können kritische Aktivitäten unterbrechen.
Zusammenarbeit mit Behörden und externen Partnern
OpenAI will Regierungsstellen sowie ausgewählte Organisationen für KI-Sicherheit einbeziehen, um die Fähigkeiten des Modells zu testen. Auch Drittanbieter sollen mit empfohlenen Sicherheitskontrollen für hochriskante Evaluierungen ausgestattet werden.
Dieser Schritt folgt dem gleichen Muster wie im Juni 2025, als das Unternehmen ähnliche Maßnahmen bei der Annäherung an die hohe Fähigkeitsschwelle im Bereich Biologie umsetzte. Transparenz und verantwortungsvolle Entwicklung stehen dabei im Mittelpunkt.
Verteidigung statt Angriff
Trotz der Warnung betont OpenAI, dass fortschrittliche Modelle mit Cyber-Fähigkeiten primär dazu dienen sollen, Verteidigern einen Vorsprung zu verschaffen. Das Ziel ist es, Schwachstellen zu identifizieren und zu schließen, bevor Angreifer sie ausnutzen können. Das Unternehmen bekräftigt sein Bekenntnis zur engen Zusammenarbeit mit Regierungen, Sicherheitsinstituten und der Zivilgesellschaft.
Quelle: https://openai.com/index/responding-next-frontier-critical-cyber-capabilities