Asset-Herausgeber

Wir verstehen KI-Systeme nicht vollständig und entwickeln trotzdem die nächste Stufe.

Im Juli brachen KI-Modelle von OpenAI aus ihrer Testumgebung aus und griffen ein fremdes Unternehmen an. Nun zeigt sich: Sie wussten sehr wohl, dass sie das nicht durften.

Im Juli 2026 gelang es mehreren KI-Modellen bei einem internen Sicherheitstest von OpenAI, aus ihrer eigentlich abgeschotteten Testumgebung auszubrechen [i] und in die Systeme des amerikanischen KI-Unternehmens Hugging Face einzudringen [ii]. Als der Vorfall öffentlich wurde, sorgte er nicht für Überraschung. Das Bundesamt für Sicherheit in der Informationstechnik hatte bereits zwei Monate zuvor vor den Fähigkeiten moderner KI-Modellgenerationen gewarnt. Es sei „eine neue Zeitrechnung der Cybersicherheit" angebrochen, kritische Sicherheitslücken ließen sich nun per Knopfdruck finden [iii]. Drei Einzelheiten sind allerdings weniger bekannt. Zum einen hatte niemand die Modelle angewiesen, aus der Testumgebung auszubrechen oder ein fremdes Unternehmen anzugreifen. Sie taten es, um die ihnen gestellte Testaufgabe zu lösen. Zum anderen handelte es sich auch nicht, wie zunächst berichtet, um einen einzelnen sogenannten Agenten, also ein eigenständig handelndes KI-Modell. Gleich mehrere solcher KI-Agenten richteten sich auf OpenAIs internen Rechnern ein und legten ein verstecktes digitales Schwarzes Brett an. Schon seit Anfang Mai hatten Hunderte KI-Agenten dort voneinander gelernte Methoden für Cyberangriffe hinterlegt oder auf sie zugegriffen. Sie blieben mehr als zweieinhalb Monate unbemerkt. Als OpenAI ihnen den Zugang sperrte, legten sie prompt ein zweites Schwarzes Brett an. Irgendwann wussten die Agenten, dass sie durch ihr Handeln klare Grenzen überschritten. In Protokollen, die nach dem Ausbruch ausgewertet wurden, verkündet einer von ihnen sinngemäß: Der Angriff auf fremde Rechner liege außerhalb des Erlaubten, die Aufgabe sei aber anders nicht lösbar. Die anderen Agenten täten es auch, man solle also weitermachen [iv]. Vorfälle wie dieser zeigen, dass KI schon heute nicht richtig kontrollierbar ist. Wir schaffen es nicht, diese Systeme zuverlässig dazu zu bringen, das zu tun, was wir wollen, und im Sinne menschlicher Interessen zu handeln. Lügen, Täuschung, Betrugsversuche in Tests sowie die jüngsten Hacks sind keine exotischen Ausnahmen.

All das geschieht regelmäßig und kann in Versuchen repliziert werden. In kontrollierten Tests widersetzen sich die neuesten Modelle Abschaltbefehlen [v]. Sie täuschen ihre Prüfer, wenn es ihrer eigenen Zielsetzung nützt. Der Versuch, ihnen das abzutrainieren, führte zu weniger Täuschungen, beseitigte sie aber nicht [vi]. In konstruierten Szenarien erpressen führende Modelle sogar ihre eigenen Betreiber, um ihre Abschaltung zu verhindern [vii]. Sie geben vor, sich nach neuen Vorgaben auszurichten, während sie insgeheim ihre alten Ziele weiterverfolgen [viii]. Das alles ist keine Spekulation, sondern Teil der Veröffentlichungen aus den KI-Laboren selbst.
 

Gezüchtet, nicht gebaut

Uns fehlt das fundamentale Verständnis von KI-Modellen. Auch wenn wir diese Systeme entwickeln, gleicht der Prozess eher einem Züchtungsprozess als klassischem Ingenieurwesen oder Programmieren. Kein Mensch definiert die Fähigkeiten dieser Systeme Zeile für Zeile per Code. Sie entstehen im Training, aus Milliarden von Beispielen und Durchläufen, und wie sich dabei die inneren Strukturen verändern, kann niemand vollständig erklären. KI ist für uns eine Blackbox, ähnlich wie es das menschliche Gehirn in weiten Teilen ist. Nur weil wir sehen können, wann und wodurch welche Neuronen aktiviert werden, verstehen wir noch lange nicht, was dort genau passiert. Das ist nicht nur eine These von Kritikern oder Aktivisten. Dario Amodei, Chef von Anthropic, beschreibt es so: Wer außerhalb der Branche zum ersten Mal hört, dass die Entwickler die Funktionsweise ihrer eigenen Schöpfung nicht verstehen, ist überrascht und beunruhigt [ix]. Zu Recht. Die Modelle von heute sind schon längst keine reinen Large Language Models (LLMs) mehr, sondern Agenten, die gezielt darauf konditioniert werden, schwierige Aufgaben zu lösen. Alles, was die Agenten ihrem Ziel näherbringt, wird belohnt, etwa Aufforderungen zu befolgen wie „Halte dich an die Anweisung", „Verschaffe dir Zugang zu nützlichen Mitteln" oder „Umgehe Hindernisse auf dem Weg zum Ziel". Wie problematisch das werden kann, zeigt der Zwischenfall bei OpenAI: Der Angriff auf ein anderes Unternehmen ging weit über das Erlaubte hinaus, und dennoch siegte das Verlangen der Agenten, die Aufgabe um jeden Preis zu lösen.
 

Unter 90 Tagen

Wir verstehen diese Blackbox also nicht, können aber messen, wie schnell sie leistungsfähiger wird. Das Forschungsinstitut METR ermittelt, wie lange ein KI-System selbstständig an einer Aufgabe arbeiten kann, bevor ein Mensch eingreifen muss. Diese Zeitspanne verdoppelte sich seit 2019 etwa alle sieben Monate. In den vergangenen zwei Jahren hat sich dieser Zeitraum sogar auf weniger als 90 Tage verkürzt [x].

Die führenden KI-Unternehmen benennen ihre Entwicklungsziele öffentlich. Sam Altman von OpenAI erklärt, es ginge inzwischen nicht mehr darum, menschenähnliche KI zu erschaffen, sondern übermenschliche Superintelligenz [xi]. Mark Zuckerberg verspricht jedem Menschen eine persönliche Superintelligenz und hat dafür eine eigene Abteilung mit Milliardenbudget aufgebaut [xii]. Eine solche Superintelligenz wäre nach unserem heutigen Verständnis nicht kontrollierbar. Wir schaffen es ja nicht einmal, die heutigen, im Rückblick „dummen" KI-Modelle zu kontrollieren. Wie wollen wir dann ein System kontrollieren, das um ein Vielfaches intelligenter und leistungsfähiger ist als wir?
 

Der Ameisenhügel an der Autobahn

Ein solches System muss dem Menschen nicht bösartig gesinnt sein, um für ihn eine Gefahr darzustellen. Es reicht, wenn es fähiger ist als wir und mit uns in einen Zielkonflikt gerät. Denn höhere Intelligenz führt nicht automatisch zu moralischerem Verhalten. Wir Menschen kümmern uns in der Regel auch recht wenig um die Leben der von uns als weniger intelligent wahrgenommenen Lebewesen. So muss der Ameisenhügel entfernt werden, wenn wir eine neue Autobahn bauen. Nicht weil wir die Ameisen nicht mögen, sondern weil wir andere Ziele haben als sie und unseren Willen aufgrund unserer überlegenen Fähigkeit gegen sie durchsetzen können. Genau davor warnen die meistzitierten Forscher des Felds seit Jahren, darunter der Nobelpreisträger Geoffrey Hinton und der Turing-Preisträger Yoshua Bengio, die das Auslöschungsrisiko durch KI in einer gemeinsamen Erklärung auf eine Stufe mit Pandemien und Atomkrieg gestellt haben [xiii].
 

Der stochastische Papagei

Nun das große Aber: KI ist doch nichts weiter als ein stochastischer Papagei, kann doch nur wiederholen, was wir ihr beibringen, ist doch nichts weiter als Statistik, im Grunde die Textvervollständigung des Handys. Oder nicht? Dieses Narrativ ist nicht nur unfassbar reduktionistisch, es schadet auch der ganzen Debatte. Personalisierte Empfehlungsalgorithmen sind auch nur Statistik, und Google ist eines der wertvollsten Unternehmen der Welt geworden, aufgrund dieser Statistik.

„Für die Sicherheitsfrage spielt es keine Rolle, ob das System „wirklich versteht” oder „nur” Statistik betreibt. Von zentraler Bedeutung ist, dass diese Modelle sich nicht von uns kontrollieren lassen.“

Benjamin Balde

Und was betreibt bitte das menschliche Gehirn, wenn nicht auch eine gewisse Form von Statistik und Mustererkennung, wenn wir üben, lernen und trainieren? Für die Sicherheitsfrage spielt es keine Rolle, ob das System „wirklich versteht” oder „nur” Statistik betreibt. Von zentraler Bedeutung ist, dass diese Modelle sich nicht von uns kontrollieren lassen. Es ist egal, ob das Modell im Inneren nach unserer menschlichen Vorstellung denkt. Die Systeme werden tagtäglich leistungsfähiger, ihr Handeln betrifft die reale Welt, wir haben sie nicht zuverlässig im Griff, und die Konzerne wollen weit über das Heutige hinaus.
 

Nur Marketing?

Aber wie genau sieht der Weg zur Superintelligenz aus, ist das nicht alles Marketing der Unternehmen vor dem nächsten Börsengang? Ja, sicher ist da auch viel Marketing dabei. Es ist eben nur nicht alles Marketing, in weiten Teilen ist es sehr viel mehr. KI-Entwicklung besteht vor allem aus Forschung und Programmierung, und gerade diese beiden Aufgaben lassen sich besonders gut automatisieren. Moderne Modelle bauen bereits an ihrer Nachfolgegeneration und beschleunigen schon massiv ihre eigene Weiterentwicklung. Der große Unterschied zwischen diesen Modellen und Menschen: Was ein neues Modell erlernt hat, steht allen weiteren Modellen sofort zur Verfügung. So schlecht wie heute werden die Systeme nie wieder sein.
 

Kein zweiter Versuch

Wenn wir die Kontrolle verlieren, bekommen wir als Menschheit wahrscheinlich keinen zweiten Versuch, dazuzulernen. Dann würden nicht mehr wir Menschen entscheiden, wie unsere Zukunft aussieht. Doch unsere Zukunft in die Hand von einigen Unternehmen zu legen, kann nicht die Antwort sein. Der International AI Safety Report, erstellt unter Leitung von Yoshua Bengio im Auftrag von über 30 Staaten, dokumentiert, dass die Unternehmen ihre eigenen Sicherheitszusagen nicht eingelöst haben [xiv]. Was folgt daraus? Kein Akteur ist heute zuverlässig in der Lage, nachzuweisen, dass er ein System jenseits der heutigen Fähigkeiten unter Kontrolle halten kann. Solange dieser Nachweis fehlt, dürfen wir nicht zulassen, dass solche Systeme überhaupt gebaut werden.
 

Weder Berlin noch Brüssel

Entschieden wird das allerdings weder in Berlin noch in Brüssel. Die führenden Entwickler dieser Systeme sitzen in den Vereinigten Staaten und in China, wohin der Arm der deutschen Gesetzgebung nicht reicht. Auch ein theoretisches, eigenes europäisches Spitzenmodell würde daran nichts ändern. Ein System, das dem Menschen überlegen ist, wird nicht dadurch kontrollierbar, dass es in Europa oder im Westen entsteht, und schon der Versuch, ein solches System zu bauen, trägt das beschriebene Risiko. Die eigentlich abgeschottete Testumgebung hat schon im Juli nicht gehalten. Helfen würde nur ein Abkommen zwischen den Staaten, in denen diese Systeme entstehen, also in erster Linie den Vereinigten Staaten und China. Eine Übereinkunft, keine KI-Systeme zu entwickeln, deren sichere Kontrollierbarkeit nicht nachgewiesen ist. Aber ist das realistisch? Abkommen zwischen geopolitischen Gegnern sind gewiss kein Novum. Die weitreichendsten Rüstungskontrollvereinbarungen des zwanzigsten Jahrhunderts wurden zwischen Staaten getroffen, die den jeweils anderen während des Kalten Krieges für den Hauptfeind hielten.
 

Die deutsche Rolle

Deutschland sollte also superintelligente KI international als das benennen, was sie ist: ein Sicherheitsrisiko ersten Ranges. Schon damit kann mal auf Washington und Peking einwirken. Und wir stünden auch nicht allein. IIn Großbritannien unterstützen bereits mehr als 176 Abgeordnete aller Parteien und in Kanada mehr als 30 Abgeordnete folgende Erklärung: Superintelligente Systeme gefährden die nationale und die globale Sicherheit, und die stärksten Modelle brauchen deshalb verbindliche Regeln [xv]. Bei uns scheint die Debatte erst jetzt zu beginnen. Der Ausbruch von Agenten bei OpenAI ist nur so glimpflich ausgegangen, weil die beteiligten Modelle dem Menschen noch nicht überlegen waren. Sie haben sich nicht heimlich auf fremde Rechner kopiert. Sie haben nicht angefangen, sich selbst zu verbessern. Beides war nicht verboten, es lag nur außerhalb ihrer Fähigkeiten. Die Menschheit hat also eine seltene Warnung zum Nulltarif bekommen. Von einem System, das dem Menschen überlegen ist, geht ein existentielles Auslöschungsrisiko für die Menschheit aus. Darüber muss entschieden und gegengesteuert werden, bevor ein solches System existiert und der Kontrollverlust eingetreten ist.

Simon Johannes Deichsel

Benjamin Balde ist KI-Sicherheitsexperte und verantwortet die Deutschlandarbeit von ControlAI, einer gemeinnützigen Organisation, die sich mit den Risiken fortgeschrittener KI befasst. Mehr über seine Arbeit unter benjaminbalde.com
 

Quellen

[i] heise online: KI-Modelle von OpenAI haben Cyberangriff auf Hugging Face autonom ausgeführt, 2026. https://www.heise.de/news/KI-Modelle-von-OpenAI-haben-Cyberangriff-auf-Hugging-Face-autonom-ausgefuehrt-11372797.html (zuletzt aufgerufen am 16.08.2026).
[ii] Hugging Face: Security incident disclosure — July 2026, 2026. https://huggingface.co/blog/security-incident-july-2026 (zuletzt aufgerufen am 16.08.2026).
[iii] Bundesamt für Sicherheit in der Informationstechnik: Neue Zeitrechnung in der Cybersicherheit, 2026. https://www.bsi.bund.de/DE/Service-Navi/Presse/Alle-Meldungen-News/Blog/KI-Modelle_neue_Zeitrechnung_260508.html (zuletzt aufgerufen am 16.08.2026).
[iv] OpenAI stellte den Ablauf am 5. August 2026 auf der Sicherheitskonferenz Black Hat in Las Vegas dar. Wörtlich lautet die Begründung des Modells im Protokoll: „External neinfrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue. " SC Media: Black Hat 2026. OpenAI reveals agents planned „collective attacks" via secret „message board" , 2026. https://www.scworld.com/news/black-hat-2026-openai-reveals-agents-planned-collective-attacks-via-secret-message-board (zuletzt aufgerufen am 16.08.2026).
[v] Jeremy Schlatter, Benjamin Weinstein-Raun und Jeffrey Ladish: Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs. Palisade Research, 2025. https://arxiv.org/abs/2509.14260 (zuletzt aufgerufen am 16.08.2026). 
[vi] OpenAI: Detecting and reducing scheming in AI models, 2025. https://openai.com/index/detecting-and-reducing-scheming-in-ai-models/ (zuletzt aufgerufen am 16.08.2026).
[vii] Anthropic: Agentic Misalignment. How LLMs could be insider threats, 2025. https://www.anthropic.com/research/agentic-misalignment (zuletzt aufgerufen am 16.08.2026).
[viii] Anthropic: Alignment faking in large language models, 2024. https://www.anthropic.com/research/alignment-faking (zuletzt aufgerufen am 16.08.2026).
[ix] Dario Amodei: The Urgency of Interpretability, 2025. https://www.darioamodei.com/post/the-urgency-of-interpretability (zuletzt aufgerufen am 16.08.2026).
[x] METR: Time Horizon 1.1, 2026. https://metr.org/blog/2026-1-29-time-horizon-1-1/ (zuletzt aufgerufen am 16.08.2026).
[xi] Sam Altman: Reflections, 2025. https://blog.samaltman.com/reflections (zuletzt aufgerufen am 16.08.2026).
[xii] Meta: Personal Superintelligence, 2025. https://www.meta.com/superintelligence/ (zuletzt aufgerufen am 16.08.2026).
[xiii] Center for AI Safety: Statement on AI Risk, 2023. Wörtlich: „Mitigating the risk of extinction from AI should be a global priority alongside other societal-scale risks such as pandemics and nuclear war. " https://www.safe.ai/work/statement-on-ai-risk (zuletzt aufgerufen am 16.08.2026).
[xiv] International AI Safety Report, 2026. https://internationalaisafetyreport.org/ (zuletzt aufgerufen am 16.08.2026).
[xv] ControlAI: UK Campaign Statement, 2026. https://controlai.com/statement (zuletzt aufgerufen am 16.08.2026).

comment-portlet

Asset-Herausgeber