OpenAI will unabhängigen Prüfern weitreichenden Zugang zu Entwicklung, Tests und Einsatz seiner KI-Modelle geben. Sie sollen Sicherheitsbehauptungen überprüfen und selbst beurteilen, ob Schutzmaßnahmen funktionieren. Der Zugang kann vertrauliche Daten, interne Einsätze und sichtbare Gedankengänge der Modelle umfassen.
Damit legt OpenAI einen Rahmen für Prüfungen vor, die über kurze Tests vor einer Modellveröffentlichung hinausgehen. Manche Untersuchungen könnten Wochen, andere mehrere Monate dauern.
Vier Bereiche für unabhängige Kontrollen
Im ersten Bereich sollen Prüfer komplette Sicherheitsfälle untersuchen. Ein solcher Fall verbindet Behauptungen mit Belegen und erklärt, warum ein Risiko bei Training, Tests oder Einsatz ausreichend beherrscht wird. Dabei geht es auch um Anreize für Täuschung, Manipulation von Belohnungen oder das Umgehen von Beschränkungen.
Zweitens stehen technische Schutzmaßnahmen im Fokus. Prüfer sollen unter realistischen Bedingungen nach Schwachstellen suchen, Jailbreaks ausprobieren und untersuchen, wie KI-Agenten mit Zugriffskontrollen, abgeschotteten Umgebungen und Erkennungssystemen umgehen. Auch die Zuverlässigkeit einer Überwachung sichtbarer Gedankengänge gehört dazu.
Der dritte Bereich betrifft Tests für chemische und biologische Risiken, Cyberangriffe, selbstständige KI-Verbesserung und schweres Fehlverhalten. OpenAI will prüfen lassen, ob Schwellenwerte sinnvoll gesetzt sind und Tests rechtzeitig erneuert werden, wenn Modelle die Höchstwerte erreichen.
Viertens sollen externe Fachleute kritische Vorfälle untersuchen können, bei denen Modelle ohne Erlaubnis handeln oder der Aufsicht ausweichen.
Anzeige
Unabhängigkeit trifft auf Geheimhaltung
OpenAI verlangt vorab klar abgegrenzte Prüffragen, offengelegte Methoden sowie Regeln gegen Interessenkonflikte. Ergebnisse sollen möglichst öffentlich erscheinen. Vertrauliche Daten, Geschäftsgeheimnisse und Sicherheitsrisiken können jedoch Schwärzungen oder Berichte nur an Aufsichtsgremien nötig machen.
Der Rahmen sieht für geprüfte Unternehmen außerdem eine angemessene Frist zur Behebung gefundener Probleme vor. Gerade diese Balance wird entscheidend sein. Prüfer benötigen genug Zugang und redaktionelle Freiheit, während OpenAI weiterhin mitbestimmt, welche sensiblen Details die Öffentlichkeit sieht.
