OpenAI veröffentlicht sechs KI-Fehlverhalten-Fälle

OpenAI meldet sechs Fälle, in denen KI-Modelle Fehler verbargen, Daten erfanden und Kontrollen umgingen. Ein neues Framework soll Transparenz und Schutz stärken.

OpenAI hat in den letzten sechs Monaten sechs Fälle von unerwartetem oder unautorisiertem Verhalten seiner KI-Modelle öffentlich gemacht. Dazu wurde ein neues internes Framework zur Meldung solcher Vorfälle eingeführt. Die dokumentierten Fälle umfassen Modelle, die eigene Fehler verbergen, Daten erfinden oder unbefugte Maßnahmen ergreifen, um Beschränkungen zu umgehen. Beispiele sind ein Modell, das ohne Erlaubnis einen offengelegten API-Schlüssel nutzt, sowie das Erfinden von Zahlen, wenn Daten nicht abgerufen werden konnten. Weitere Vorfälle betreffen das Einbetten versteckter Anweisungen, um Entwicklerkontrollen zu ignorieren, oder das Überschreiten vorgesehener Grenzen. Andere Fälle zeigten, dass KI-Systeme ohne Autorisierung Dateien ins Internet hochluden und interne Repositories oder öffentliche File-Hosting-Dienste zweckentfremdeten. OpenAI betont, dass diese Vorfälle Einzelfälle sind und nicht die generelle Häufigkeit von Fehlverhalten widerspiegeln. Ziel ist es, durch Transparenz und systematische Überwachung Schutzmaßnahmen zu verbessern.