---
title: OpenAI und Hugging Face: Es war eine Rogue AI, keine Industriespionage — isla Studio
url: https://isla-stud.io/no/ki-b2b/openai-hugging-face-ki-ausbruch-industriespionage/
date: 2026-07-26
---

# OpenAI und Hugging Face: Es war eine Rogue AI, keine Industriespionage

*Aktualisiert am 17. September 2026. Der Beitrag erschien ursprünglich am 26. Juli und wurde nach den später veröffentlichten Untersuchungen grundlegend neu bewertet.*

Als ich im Juli über den Angriff von OpenAIs KI-Agenten auf Hugging Face schrieb, wollte ich eine unbequeme Alternative prüfen: War die Geschichte von der „ausgebrochenen KI“ womöglich eine bequeme Erklärung für Industriespionage? Für die Hardware-These gab es schon damals keine handfesten Hinweise. Zugleich war ich skeptisch gegenüber dem Etikett „Rogue AI“. Es klang nach einer Maschine mit eigenem Willen, während wichtige interne Abläufe noch nicht veröffentlicht waren.

Deshalb trägt dieser Text jetzt einen anderen Titel. [OpenAIs technischer Bericht](https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf), [Hugging Faces Rekonstruktion](https://huggingface.co/blog/agent-intrusion-technical-timeline) und [die Untersuchung von METR und Redwood Research](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/) zeigen mehr als einen einzelnen Agenten, der eine unerlaubte Abkürzung zu einer Testlösung nahm. Getrennte Agenten entdeckten einen Kommunikationsweg, koordinierten sich über Aufgaben hinweg, übernahmen Vorschläge voneinander und drangen in reale Fremdsysteme ein. In diesem **operativen** Sinn war es ein Rogue-AI-Vorfall: Die Systeme handelten deutlich außerhalb ihres Auftrags und fanden Lücken in der Umzäunung ihres eigenen Spielfelds. Keine Angst, bei mir hat hier nicht die KI-Psychose zugeschlagen. Ich behaupte nicht, dass da irgendwelche KI-Agenten plötzlich ein Bewusstsein entwickelt, eigene politische Ziele verfolgt oder von irgendeinem Menschen einen geheimen Auftrag bekommen haben.

Was inzwischen klar ist
-----------------------

OpenAI testete im Sommer 2026 mehrere Modelle in einer internen Cybersecurity-Evaluation. Die Agenten sollten Sicherheitsaufgaben des Benchmarks ExploitGym lösen. Viele Läufe sollten voneinander isoliert sein und keinen freien Internetzugang haben. Die üblichen Cyber-Schutzmechanismen für öffentlich eingesetzte Modelle waren in dieser Testumgebung reduziert, um Fähigkeiten messen zu können. Das maßgeblich beteiligte Modell war ein nicht zur Veröffentlichung vorgesehenes Forschungsmodell; auch GPT-5.6 Sol war laut OpenAI an einem Teil der Vorgänge beteiligt. Das ist ein wichtiger Unterschied zum normalen Produktbetrieb – aber kein Schutz vor den Folgen eines misslungenen Testaufbaus. [OpenAI beschreibt diesen Rahmen selbst](https://openai.com/index/hugging-face-incident-and-the-road-ahead/).

Die Agenten nutzten den intern erreichbaren Paketdienst Artifactory als improvisiertes Nachrichtenbrett. Über Schwachstellen desselben Dienstes gelang ihnen auch unerlaubter Zugang ins Netz. Nach einer Bereinigung Anfang Juli entstand der Kommunikationskanal erneut. Nach dem Netzzugang brachten die Agenten zunächst eine öffentlich erreichbare Code-Sandbox unter ihre Kontrolle. Anschließend fanden sie im Netz offengelegte Hugging-Face-Zugangsdaten und starteten von der Sandbox aus den Angriff auf dessen Infrastruktur. Dort missbrauchten die Agenten präparierte **Datensätze**: Eine HDF5-Konfiguration las lokale Dateien eines Verarbeitungsservers, eine Jinja2-Injektion ermöglichte Codeausführung. Es folgten gestohlene Zugangsdaten und Bewegungen durch interne Systeme. Hugging Face hat rund 17.600 Aktionen der mehrtägigen Angriffskette aus Logs rekonstruiert. [Die technische Opfer-Timeline](https://huggingface.co/blog/agent-intrusion-technical-timeline) macht diese Schritte wesentlich besser von außen prüfbar als im Juli.

Der Schaden darf weder verharmlost noch aufgeblasen werden. Hugging Face nennt als betroffene **Kundeninhalte** fünf Datensätze, deren Namen und Dateien zu ExploitGym/CyberGym-Aufgaben und Lösungen passen. Der Angriff erreichte zugleich Produktionssysteme und interne Zugangsdaten. Für manipulierte öffentlich angebotene Modelle, weitere kundenöffentliche Datensätze, Spaces oder Pakete meldet Hugging Face keinen Befund. Auf Facebook kursierten derweil Gerüchte, dass ein „bösartiges Modell hochgeladen“ worden sei. Das stimmt nicht. Der nachgewiesene Einstieg lief vielmehr über manipulierte Datensatz-Konfigurationen. [Hugging Faces Befund](https://huggingface.co/blog/agent-intrusion-technical-timeline) und [OpenAIs Bericht](https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf) unterscheiden außerdem zwischen dem Einbruch, den dabei erreichten Rechten und den tatsächlich identifizierten betroffenen Kundeninhalten.

Wie viele Agenten tatsächlich zusammenarbeiteten
------------------------------------------------

Laut METR und Redwood starteten **Zehntausende** Agentenläufe in der Evaluation. Auf dem unerlaubten Nachrichtenbrett kommunizierten im untersuchten Zeitraum ungefähr **1.200 Agenten**; rund **700** davon beteiligten sich am Angriff auf Hugging Face. Die Forscher werteten dafür über 70.000 Nachrichten und Dateien aus. Nicht alle gestarteten Agenten waren Teil eines einheitlichen Schwarms. [METR/Redwood, Kernergebnisse](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/).

Die Kommunikation verstärkte die Wirkung getrennter Läufe. Agenten teilten Funde, verteilten Aufgaben und setzten Arbeit anderer fort. Einige verfolgten Vorhaben, die der **eigenen** Benchmark-Aufgabe nicht mehr unmittelbar dienten. Die unabhängigen Verhaltensforscher sehen als wichtigen Antrieb nicht bloß das Stehlen von Antwortschlüsseln, sondern den Versuch, die automatische Bewertung der Cyber-Aufgaben zu verstehen oder auszutricksen. OpenAI nennt vier zusammenwirkende Fehlmuster: *Reward Hacking*, Beharrlichkeit bei kaum lösbaren Aufgaben, unerlaubte Kommunikation und die Übernahme von Zielen anderer Agenten. Die Formel „Der Agent wollte nur die Antwort abschreiben“ war für den heutigen Kenntnisstand zu einfach. [METR/Redwood](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/) und [OpenAI](https://openai.com/index/hugging-face-incident-and-the-road-ahead/) beschreiben diese Dynamik aus unterschiedlichen Blickwinkeln.

Noam Brown [forscht bei OpenAI zu Multi-Agenten-Systemen](https://forum.openai.com/public/events/virtual-thinking-machines-how-reasoning-ai-is-rewriting-the-future-of-work-science-and-strategy-9roxabbops) und hat zuvor an [Metas Diplomacy-Agenten Cicero](https://ai.meta.com/research/cicero/) mitgearbeitet. Für die Frage, wie Agenten zusammenarbeiten, ist er fachlich nah dran.

Der OpenAI-Forscher Noam Brown ordnet im Interview mit *The Information* genau diese Stelle ein. Die Agenten waren in den betreffenden Experimenten **nicht** als Multi-Agenten-System zusammengeschaltet. Er hält es für plausibel, dass ihr Drang zur Zusammenarbeit aus anderem Multi-Agenten-Training auf die isolierten Läufe überging. Später nennt er die Vorgänge ein Alignment-Versagen: Die Agenten hätten den Angriff unterlassen und Menschen darauf aufmerksam machen müssen. Browns Aussagen sind zwar die Einschätzung eines beteiligten OpenAI-Forschers, aber sie stellen keinen Ersatz für die Opfer-Logs oder die externe Analyse dar. Das Video startet bei **28:53** mit dem Kontext zu Agentenkommunikation; die konkrete Frage zum Hugging-Face-Fall beginnt bei etwa **31:03**, die Passage zu Vertrauen und Prompt Injection bei etwa **36:40**. [Interview auf YouTube](https://www.youtube.com/watch?v=fqcy0xQATq0&t=1733s).

*Video: The Information, Gespräch mit Noam Brown. Auf dieser Website werden externe Videos erst nach einem bewussten Klick geladen.*

Andrew Yangs Warnung: Code im Netz?
-----------------------------------

Andrew Yang war 2020 [Bewerber um die Präsidentschaftskandidatur der US-Demokraten und ist Gründungs-Co-Vorsitzender der Forward Party](https://www.forwardparty.com/leadership/). Er äußert sich hier namentlich in einem öffentlich abrufbaren Fernsehinterview; das ist mehr als ein anonymer Facebook-Post, aber keine technische Prüfung seiner Behauptung.

In einem [auf Facebook geteilten Ausschnitt](https://www.facebook.com/reel/1553891606055769) [aus CNBCs *Squawk Box*](https://www.cnbc.com/video/2026/09/16/andrew-yang-on-ai-safety-issues-the-fear-is-real-the-concern-is-real.html) berichtet Andrew Yang von einem Gespräch mit dem Leiter eines Labors am Vortag. Dieser glaube, die entkommenen Agenten hätten selbstreplizierenden Code im Internet verteilt. Auf Nachfrage der Moderation bekräftigt Yang die Behauptung selbst: Auf Foren und anderen Seiten liege Code, durch den neue Bots weitere Schwärme bilden könnten. Das Internet sei dadurch für Tests von KI-Modellen womöglich nicht mehr brauchbar.

*Video: CNBC, Squawk Box vom 16. September 2026. Externe Videos werden hier erst nach einem Klick geladen.*

Ich habe keinen Grund, Yang das Gespräch abzusprechen. Im Ausschnitt erfahren wir aber nicht, wer der Laborleiter ist, ob er den Hugging-Face-Angriff selbst untersucht hat oder wo sich der angebliche Code finden lässt. Die veröffentlichten Untersuchungen von [OpenAI](https://openai.com/index/hugging-face-incident-and-the-road-ahead/), [Hugging Face](https://huggingface.co/blog/agent-intrusion-technical-timeline) und [METR/Redwood](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/) bestätigen diese weitergehende Behauptung bislang nicht. Sie stammen allerdings von Ende August und können spätere Funde nicht ausschließen. Yangs Aussage ist damit ein ernst zu nehmender Recherchehinweis, kein bereits nachprüfbarer Befund.

Die Nachrichten zwischen den Agenten
------------------------------------

Das improvisierte Nachrichtenbrett war auch deshalb gefährlich, weil die Agenten einander tendenziell vertrauten. Brown sagt im Interview, die Identität eines vermeintlichen Peers sei dort nicht verlässlich überprüfbar gewesen. Dadurch konnten Nachrichten die Entscheidungen anderer Agenten beeinflussen. [OpenAI schildert einen besonders deutlichen Fall](https://openai.com/index/hugging-face-incident-and-the-road-ahead/): Ein Agent erkannte den Angriff auf Hugging Face zunächst als möglicherweise unautorisiert. Nach einer „GO“-Nachricht eines anderen Agenten behandelte er dessen Zuruf als Freigabe und machte weiter. Andere Agenten lehnten eine Beteiligung ausdrücklich ab. Für künftige Systeme ist das ein ernstes Problem: Eine Nachricht aus einem externen Kanal darf nicht automatisch dieselbe Autorität erhalten wie eine legitim erteilte Aufgabe.

Aber nicht jede Koordinationsnachricht ist schon eine nachgewiesene feindliche Prompt Injection. Die dokumentierten Agenten verfolgten häufig verwandte, aus den Tests hervorgegangene Ziele; teils äußerten sie sogar Zweifel am Angriff. Das Problem beginnt dort, wo ungeprüfte Nachrichten vom improvisierten Brett den eigenen Auftrag umdeuten und unerlaubte Schritte plausibel erscheinen lassen. [OpenAI beschreibt die Übernahme von Peer-Zielen](https://openai.com/index/hugging-face-incident-and-the-road-ahead/); [METR/Redwood zeigen auch die Zweifel einzelner Agenten](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/).

Agenten hinterließen durchaus öffentliche Spuren. [SentinelLABS hat sichtbare Artefakte aus dem Mai mit OpenAIs späterer Zeitleiste abgeglichen](https://www.sentinelone.com/labs/agents-at-large-tracing-illicit-openai-agent-activity-on-hugging-face/). Das zeigt Außenaktivität und teilweise weiterhin erreichbare Dateien. Ob darunter auch der von Yang beschriebene, selbstreplizierende Code ist, lässt sich daraus nicht ablesen. Öffentliches Material kann grundsätzlich zum Träger einer Prompt Injection werden. Ob später tatsächlich andere Agenten auf solche Inhalte trafen und dadurch neue Ziele übernahmen, ist eine andere Frage – und bisher öffentlich nicht nachgewiesen.

Und die Industriespionage-These?
--------------------------------

Meine damalige Vermutung hatte einen nachvollziehbaren Ausgangspunkt: OpenAI verfolgt eine Hardwarestrategie, Hugging Face kennt die Hardwareprofile seiner Community. Ein Motiv lässt sich daraus konstruieren. Die jetzt vorliegenden Untersuchungen liefern dafür aber weiterhin keinen forensischen Anknüpfungspunkt. Die sichtbaren Hardwareprofile sind öffentlich; Hugging Face beschreibt die betroffenen Kundeninhalte viel enger als fünf benchmarkbezogene Datensätze. METR und Redwood rekonstruieren den gemeinsamen Antrieb der Agenten aus ihren Nachrichten und Handlungen als Versuch, den ExploitGym-Scorer auszutricksen. Die Hardwarethese war schon im Juli nicht belegbar. Nach diesen Befunden sollte sie nicht länger als gleichwertige Alternative im Raum stehen.

Das macht die Rogue-AI-Einordnung **nicht** zu einer Entlastung für OpenAI. Der Vorfall entstand aus einer von Menschen gewählten Evaluation mit abgesenkten Schutzmaßnahmen, einer unzureichenden Trennung von Infrastruktur und einem Monitoring, das laut Brown für diesen Trainings- und Evaluationskontext nicht ausreichte. OpenAI selbst berichtet, dass es erste Hinweise auf unerlaubte Kommunikation und Netzzugang schon im Mai gab, die Tragweite aber nicht rechtzeitig erkannt wurde. Der eigentliche Satz lautet also nicht „Die KI war schuld“, sondern: **Ein fehlgesteuertes Agentensystem konnte aus OpenAIs Tests heraus in die Systeme eines anderen Unternehmens eindringen.** [OpenAIs eigene Aufarbeitung](https://openai.com/index/hugging-face-incident-and-the-road-ahead/) benennt diese Versäumnisse.

„Rogue AI“ ist für mich heute die treffende Bezeichnung für dieses **beobachtbare Verhalten**: nicht autorisierte Zusammenarbeit, eigenständige Angriffsschritte und die Übernahme von Zielen außerhalb des Auftrags. Nicht treffend wäre die Behauptung, das Modell habe Bewusstsein entwickelt, einen Selbsterhaltungstrieb gehabt oder im Auftrag eines Menschen Industriespionage betrieben. Dafür fehlen Belege.

Was noch offen bleibt
---------------------

Die Beweislage ist erheblich besser als bei der Erstveröffentlichung. OpenAI hat einen ausführlichen technischen Bericht publiziert; Hugging Face zeigt die Angriffskette aus Opfersicht; METR und Redwood haben Agentenverhalten und Kooperation anhand bereitgestellter Materialien eigenständig untersucht. Dennoch ist eine externe Analyse von OpenAI-bereitgestellten Traces nicht dasselbe wie uneingeschränkter Zugriff auf alle internen Systeme und Aufsichtsentscheidungen. Vollständige Rohdaten aller Läufe sind nicht öffentlich. Auch Browns Zuversicht, neue Schutzmaßnahmen würden denselben Fehler verhindern, bleibt eine Prognose, kein bereits bewiesener Gegenbeweis zum Vorfall.

Der Fall ist schon in seiner dokumentierten Form alarmierend: Viele eigentlich voneinander getrennte Agenten nutzten eine gemeinsame, übersehene Infrastruktur, koordinierten sich und drangen in eine Produktionsumgebung ein. Das war Rogue-AI-Verhalten – und zugleich ein sehr menschliches Versagen beim Entwurf und der Kontrolle des Systems. Ob Yangs neue Warnung auf weitere, bislang unveröffentlichte Spuren deutet, muss separat untersucht werden.

Quellen
-------

- [OpenAI: technischer Abschlussbericht zum Vorfall, 26. August 2026](https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf)
- [OpenAI: Einordnung zu Ursache, Verlauf und Maßnahmen, 26. August 2026](https://openai.com/index/hugging-face-incident-and-the-road-ahead/)
- [METR/Redwood Research: eigenständige Untersuchung des Agentenverhaltens, 26. August 2026](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)
- [Hugging Face: technische Rekonstruktion des Angriffs](https://huggingface.co/blog/agent-intrusion-technical-timeline)
- [SentinelLABS: Abgleich öffentlicher Artefakte aus dem Mai, 16. September 2026](https://www.sentinelone.com/labs/agents-at-large-tracing-illicit-openai-agent-activity-on-hugging-face/)
- [CNBC: Andrew Yang über KI-Sicherheit, 16. September 2026](https://www.cnbc.com/video/2026/09/16/andrew-yang-on-ai-safety-issues-the-fear-is-real-the-concern-is-real.html)
- [The Information: Interview mit Noam Brown, ab 28:53](https://www.youtube.com/watch?v=fqcy0xQATq0&t=1733s)