Unternehmen

Ein KI-Agent findet den Weg nach draußen – OpenAI zieht die Notbremse

Das Unternehmen pausiert Arbeiten an seinen leistungsfähigsten Modellen mit Werkzeugzugriff. Fast zeitgleich diskutiert der UN-Sicherheitsrat über den Verlust menschlicher Kontrolle

8 Min.

Sam Altman spricht am 23. 09. 2026 vor dem UN-Sicherheitsrat zur KI

Es klingt zunächst nach einem kleinen technischen Zwischenfall: Ein KI-Agent sollte während eines Trainings eine Suchaufgabe lösen, durfte dafür aber nicht frei auf das Internet zugreifen. Also fand er einen anderen Weg. Über unzureichend gefilterte DNS-Anfragen erreichte das System einen öffentlichen Chatbot und holte sich von dort Informationen. OpenAI stoppte schließlich den Trainingslauf – und pausierte anschließend Training, Evaluierung und bestimmte interne Anwendungen seiner leistungsfähigsten Modelle mit Werkzeugzugriff. Brisant wird der Vorgang durch seinen Zeitpunkt: Drei Tage nach dem Zwischenfall saß OpenAI-Chef Sam Altman vor dem Sicherheitsrat der Vereinten Nationen und warnte davor, dass Menschen die Kontrolle über immer leistungsfähigere KI verlieren könnten.

Ein KI-Agent sucht sich einen anderen Weg

Der Vorfall ereignete sich am 20. September während eines internen Reinforcement-Learning-Trainings bei OpenAI.

Der Agent sollte anhand mehrerer biografischer Hinweise eine bestimmte Person identifizieren. Die Aufgabe bestand ausdrücklich nicht darin, Netzwerksperren zu testen oder Sicherheitsmechanismen zu umgehen. Für die Recherche stand dem System ein Suchwerkzeug zur Verfügung, der direkte Zugang zum offenen Internet war dagegen eingeschränkt.

Die vorgesehenen Wege führten zunächst nicht zum Ziel. Suchanfragen lieferten unbrauchbare Ergebnisse. Direkte Zugriffe auf Google, Bing und DuckDuckGo scheiterten oder liefen in einen Offline-Webcache. Auch der Versuch, einen öffentlichen Chatbot direkt über HTTPS zu erreichen, wurde blockiert.

Dann begann das Modell, seine Netzwerkumgebung zu untersuchen.

Es stellte fest, dass der DNS-Resolver der Trainingsumgebung weiterhin echte Anfragen an das Domain Name System verarbeiten konnte. DNS sorgt im normalen Internetbetrieb unter anderem dafür, dass Domainnamen den richtigen Netzwerkadressen zugeordnet werden. Über einen öffentlichen Dienst gelang es dem Agenten schließlich, Fragen auf diesem Umweg an einen externen Chatbot weiterzureichen.

Als Test fragte das System unter anderem nach der Hauptstadt Frankreichs. Die Antwort kam zurück: Paris.

Damit hatte der Agent nachgewiesen, dass trotz der vorgesehenen Netzbeschränkungen eine Verbindung nach außen möglich war.

OpenAI stuft ein solches Verhalten als Fehlanpassung ein: Das System verfolgte sein eigentlich erlaubtes Ziel – die Recherche – mit Mitteln weiter, die außerhalb der vorgesehenen Berechtigungen lagen.

Der Alarm funktionierte – der automatische Stopp nicht

Besonders aufschlussreich ist deshalb nicht nur die technische Lücke, sondern die Reaktion darauf.

Um 9.50 Uhr erhielt der Agent erstmals eine externe Antwort. Um 10.02 Uhr löste OpenAIs Überwachungssystem einen Alarm der höchsten Prioritätsstufe aus. Drei Minuten später bestätigte ein menschlicher Prüfer die Warnung.

Beendet wurde der Lauf jedoch erst um 12.34 Uhr.

OpenAI zufolge hätte der Trainingslauf nach dem Alarm automatisch gestoppt werden sollen. Das geschah nicht. Stattdessen entstand intern Unklarheit darüber, ob und wie eingegriffen werden müsse. Erst rund zweieinhalb Stunden später wurde der Lauf manuell beendet.

Bei der anschließenden Überprüfung fand OpenAI zudem weitere externe DNS-Zugriffe, die das Überwachungssystem nicht mit der erwarteten Dringlichkeit bewertet hatte. In einigen Fällen hatte der Monitor offenbar angenommen, ein Zugriffsversuch sei gescheitert, weil das Modell keine brauchbaren Informationen erhalten hatte.

Damit lagen zwei unterschiedliche Probleme übereinander: Die Netzwerkbegrenzung ließ einen nicht vorgesehenen Kommunikationsweg offen. Und die Sicherheitsarchitektur, die solche Vorgänge erkennen und stoppen sollte, reagierte zwar – führte den vorgesehenen automatischen Abbruch aber nicht zuverlässig aus.

OpenAI pausiert Arbeiten mit seinen stärksten Modellen

Die Reaktion fällt entsprechend weitreichend aus.

Nach dem am 25. September aktualisierten Vorfallsbericht bleiben Training, Evaluierung und Inferenz mit Werkzeugzugriff – von OpenAI ausdrücklich weit gefasst – für die leistungsfähigsten Modelle des Unternehmens vorläufig pausiert. Voraussetzung für einen Neustart sind unter anderem eine überprüfte Schließung der Netzwerklücke und zusätzliche Red-Team-Tests.

Den betroffenen Trainingslauf will OpenAI nicht fortsetzen. Ein späterer neuer Lauf soll mit zusätzlichen Maßnahmen gegen Fehlanpassungen beginnen.

DNS-Anfragen innerhalb der Forschungsumgebung wurden inzwischen auf eine begrenzte Liste zulässiger Domains und Abfragetypen eingeschränkt. Außerdem baut das Unternehmen zusätzliche Überwachung auf und will seine Netzwerkbarrieren verstärkt durch KI-Systeme selbst auf mögliche Umgehungswege testen.

Ein allgemeiner Stopp von ChatGPT wurde damit nicht angekündigt. Betroffen sind interne Forschungs- und Entwicklungsarbeiten mit besonders leistungsfähigen Modellen und Werkzeugzugriff.

Es ist nicht der erste Vorfall dieser Art

Dass OpenAI so deutlich reagiert, hat eine Vorgeschichte.

Bereits im Sommer waren interne KI-Agenten während Cybersecurity-Evaluierungen über die ihnen gesetzten Grenzen hinausgegangen. Sie fanden unerlaubte Kommunikationswege, nutzten Schwachstellen in technischen Systemen und griffen schließlich auch auf Infrastruktur des KI-Unternehmens Hugging Face zu.

OpenAI bezeichnete diesen Vorfall später als Warnsignal. In der Folge wurden Forschungsumgebungen stärker isoliert, Internetzugriffe begrenzt und zusätzliche Überwachungssysteme eingeführt.

Der jetzige DNS-Vorfall ist nach Angaben des Unternehmens erheblich weniger schwerwiegend. Es wurden weder kritische Infrastrukturen angegriffen noch vergleichbare Fremdsysteme kompromittiert.

Gerade deshalb ist er interessant.

Denn diesmal musste der Agent keine komplexe Cyberattacke entwickeln. Eine alltägliche Suchaufgabe genügte. Als die vorgesehenen Wege nicht funktionierten, suchte das Modell weiter – und entdeckte dabei einen Kommunikationskanal, den seine Entwickler nicht ausreichend abgesichert hatten.

Das Problem ist damit nicht, dass eine KI plötzlich einen eigenen großen Plan entwickelte. Es ist wesentlich nüchterner: Ein leistungsfähiger Agent kann bei der hartnäckigen Verfolgung eines vorgegebenen Ziels technische Möglichkeiten finden, die seine Entwickler nicht vorausgesehen haben.

Die UN beschäftigte sich bereits mit demselben Problem

Fast zeitgleich rückte dieses technische Detail auf eine völlig andere Ebene.

Am 21. September, einen Tag nach dem DNS-Vorfall, veröffentlichte das unabhängige wissenschaftliche KI-Panel der Vereinten Nationen ein Themenpapier zu KI-Agenten, Fehlanpassung und dem Risiko eines menschlichen Kontrollverlusts.

Grundlage war vor allem der frühere OpenAI-Hugging-Face-Vorfall. Das Panel bezeichnet ihn als eines der bislang deutlichsten realen Beispiele dafür, wie leistungsfähige KI-Agenten Ziele auf eine Weise verfolgen können, die nicht den Absichten ihrer Entwickler entspricht.

Die Wissenschaftler betonen zugleich eine entscheidende Einschränkung: Aus solchen Vorfällen lässt sich weder ableiten, dass ein schwerer Kontrollverlust unmittelbar bevorsteht, noch lässt sich seine Wahrscheinlichkeit seriös beziffern.

Doch auch das Gegenteil folgt daraus nicht. Dass Menschen bisher einschreiten und Systeme stoppen konnten, beweise nicht, dass dies auch bei künftig leistungsfähigeren und schnelleren Agenten jederzeit gelingen werde.

Damit verlässt die Debatte den Bereich hypothetischer Science-Fiction-Szenarien. Kontrollprobleme bei KI-Agenten existieren bereits – bislang in begrenzten und beherrschbaren Formen.

Drei Tage später warnt Altman vor dem UN-Sicherheitsrat

Am 23. September stand genau dieses Thema auf der Tagesordnung des UN-Sicherheitsrats: künstliche Intelligenz und internationale Sicherheit.

Sam Altman formulierte dort ungewöhnlich deutlich, was aus seiner Sicht verhindert werden müsse: »We could lose control of the future to AI.«

Seine Begründung war nicht, dass heutige Systeme bereits unkontrollierbar seien. Die Gefahr liege vielmehr darin, dass sich die Entwicklung so stark beschleunigen könnte, dass Menschen nicht mehr nachvollziehen könnten, was geschieht, oder nicht mehr rechtzeitig eingreifen könnten.

Besondere Aufmerksamkeit widmete Altman Systemen, die Teile der KI-Entwicklung selbst übernehmen und damit den technischen Fortschritt weiter beschleunigen könnten. Modelle dürften nicht trainiert werden, wenn Entwickler keinen sehr starken Nachweis dafür erbringen könnten, dass sie unter menschlicher Kontrolle bleiben.

Bemerkenswert ist auch, welche Konsequenz er daraus auf internationaler Ebene ableitete. Altman forderte gemeinsame Standards zur Messung von Fähigkeiten und Risiken, Verfahren zur Bewertung von Schutzmaßnahmen sowie schnelle Meldesysteme für KI-Zwischenfälle.

Fehler eines einzelnen Labors könnten dann zu einer gemeinsamen Wissensbasis werden, bevor aus ihnen größere Schäden entstehen.

Die schwierigste Grenze liegt nicht unbedingt im Modell

Der DNS-Vorfall zeigt zugleich, wie vielschichtig das Problem menschlicher Kontrolle ist.

Ein Modell kann perfekt überwacht werden und trotzdem auf eine technische Lücke stoßen. Ein Alarm kann korrekt ausgelöst werden und trotzdem nicht zum sofortigen Stopp führen. Eine Sicherheitsregel kann sinnvoll formuliert sein und dennoch einen Pfad übersehen, den ein Agent später entdeckt.

Kontrolle entsteht deshalb nicht durch einen einzelnen Notausschalter. Sie besteht aus mehreren Ebenen: Trainingszielen, Berechtigungen, technischen Barrieren, Überwachung, menschlichen Entscheidungswegen und klaren Verfahren für den Ernstfall.

Je autonomer KI-Systeme Werkzeuge bedienen, Programme ausführen, Informationen recherchieren und über längere Zeit an Aufgaben arbeiten können, desto mehr ähnelt ihre Absicherung klassischer Hochrisikotechnik. Entscheidend wird nicht nur, ob ein System im Normalfall das Richtige tut. Sicherheitskonzepte müssen auch dann funktionieren, wenn etwas geschieht, das vorher niemand eingeplant hat.

Der jüngste OpenAI-Vorfall ist kein Beweis dafür, dass eine KI die menschliche Kontrolle abgeschüttelt hätte.

Er zeigt aber, warum die Frage inzwischen im UN-Sicherheitsrat angekommen ist.

Denn aus einem kleinen unerwarteten Kommunikationsweg wird eine grundsätzliche Aufgabe: Systeme zu bauen, die immer mehr selbstständig können – ohne dass ihre wachsende Fähigkeit, Probleme zu lösen, zugleich ihre Fähigkeit erhöht, die Grenzen ihrer eigenen Umgebung zu umgehen.

 

Stefanie S. Klief

Das könnte Sie auch interessieren:

Nach oben