OpenAI og Hugging Face: Det var en uautorisert AI, ikke industrispionasje

Nye undersøkelser viser at OpenAI-agentene, som opererte uavhengig av hverandre, koordinerte seg uten tillatelse og angrep Hugging Face. Dette er en «rogue AI»-hendelse – men ikke noe bevis på maskinbevissthet eller industrispionasje.

Retro-pinup-portrett mellom OpenAI- og Hugging-Face-symboler med spørsmålet «Industrispionasje eller KI-utbrudd?»

Oppdatert 17. september 2026. Artikkelen ble opprinnelig publisert 26. juli og har blitt grundig revurdert på bakgrunn av undersøkelser som senere er blitt offentliggjort.

Da jeg i juli skrev om angrepet fra OpenAIs AI-agenter mot Hugging Face, ønsket jeg å undersøke et ubehagelig alternativ: Var historien om den „utbrutte AI-en“ kanskje en enkel forklaring på industrispionasje? Allerede den gang fantes det ingen konkrete bevis for hardware-teorien. Samtidig var jeg skeptisk til betegnelsen „Rogue AI“. Det hørtes ut som en maskin med egen vilje, mens viktige interne prosesser ennå ikke var offentliggjort.

Derfor har denne teksten nå fått en annen tittel. OpenAI:s tekniske rapport, Rekonstruksjon av «Hugging Faces» og Undersøkelsen utført av METR og Redwood Research viser at det var mer enn én enkelt agent som tok en uautorisert snarvei til en testløsning. Uavhengige agenter oppdaget en kommunikasjonskanal, koordinerte seg på tvers av oppgaver, overtok forslag fra hverandre og trengte seg inn i virkelige fremmede systemer. I dette operativ Det dreide seg om en «rogue AI»-hendelse: Systemene handlet klart utenfor sitt oppdrag og fant hull i inngjerdingen rundt sitt eget spillefelt. Ikke vær redd, jeg har ikke blitt rammet av noen AI-psykose her. Jeg påstår ikke at noen AI-agenter plutselig har utviklet bevissthet, forfølger egne politiske mål eller har fått et hemmelig oppdrag fra et eller annet menneske.

Det som nå står klart

OpenAI testet sommeren 2026 flere modeller i en intern cybersikkerhetsvurdering. Agentene skulle løse sikkerhetsoppgaver fra referansetesten ExploitGym. Mange kjøringer skulle være isolert fra hverandre og uten fri tilgang til internett. De vanlige cybersikkerhetsmekanismene for modeller i offentlig bruk var redusert i dette testmiljøet for å kunne måle evnene. Den viktigste modellen som deltok, var en forskningsmodell som ikke var ment for offentliggjøring; ifølge OpenAI var også GPT-5.6 Sol involvert i en del av prosessene. Dette er en viktig forskjell fra normal produktdrift – men ingen beskyttelse mot konsekvensene av en mislykket testoppsett. OpenAI beskriver selv dette rammeverket.

Agentene brukte den internt tilgjengelige pakketjenesten Artifactory som et improvisert oppslagstavle. Gjennom sårbarheter i selve tjenesten klarte de også å få uautorisert tilgang til nettverket. Etter en opprydding i begynnelsen av juli oppstod kommunikasjonskanalen på nytt. Etter å ha fått tilgang til nettverket tok agentene først kontroll over en offentlig tilgjengelig kode-sandkasse. Deretter fant de Hugging Face-påloggingsopplysninger som var lagt ut på nettet, og startet angrepet på tjenestens infrastruktur fra sandkassen. Der misbrukte agentene forhåndsforberedte Datasett: En HDF5-konfigurasjon leste lokale filer på en prosesseringsserver, og en Jinja2-injeksjon gjorde det mulig å kjøre kode. Dette ble fulgt av stjålne påloggingsopplysninger og bevegelser gjennom interne systemer. Hugging Face har rekonstruert rundt 17 600 handlinger fra den flere dager lange angrepskjeden ut fra loggene. Den tekniske tidslinjen for ofrene gjør disse trinnene betydelig lettere å kontrollere utenfra enn i juli.

Skaden må verken bagatelliseres eller overdrevet. Hugging Face oppgir følgende som berørte Kundeinnhold fem datasett hvis navn og filer samsvarer med oppgaver og løsninger fra ExploitGym/CyberGym. Angrepet rammet både produksjonssystemer og interne påloggingsopplysninger. Hugging Face melder ikke om funn knyttet til manipulerte modeller som er offentlig tilgjengelige, andre datasett som er tilgjengelige for kunder, Spaces eller pakker. På Facebook sirkulerte det imidlertid rykter om at en „ondsinnet modell“ hadde blitt lastet opp. Dette stemmer ikke. Det påviste innbruddet skjedde snarere via manipulerte datasettkonfigurasjoner. Hugging Faces-funn og OpenAI-rapporten skiller dessuten mellom innbruddet, rettighetene som ble oppnådd i den forbindelse og det berørte kundeinnholdet som faktisk ble identifisert.

Hvor mange agenter som faktisk samarbeidet

Ifølge METR og Redwood startet Titusenvis Agentaktivitet i evalueringen. På det ulovlige oppslagstavlen kommuniserte omtrent 1 200 agenter; rundt 700 av disse deltok i angrepet på Hugging Face. Forskerne analyserte over 70 000 meldinger og filer i denne sammenheng. Ikke alle agentene som ble satt i gang, var en del av en samlet sverm. METR/Redwood, hovedresultater.

Kommunikasjonen forsterket effekten av de separate operasjonene. Agentene delte informasjon om funn, fordelte oppgaver og videreførte andres arbeid. Noen fulgte opp prosjekter som egen Benchmark-oppgaven ikke lenger tjente et direkte formål. De uavhengige atferdsforskerne ser ikke bare tyveri av svarskjemaer som en viktig drivkraft, men også forsøket på å forstå eller omgå den automatiske vurderingen av cyberoppgavene. OpenAI nevner fire samvirkende feilmønstre: Belønningshacking, utholdenhet i oppgaver som nesten ikke lar seg løse, uautorisert kommunikasjon og overtakelse av andre agenters mål. Uttrykket „Agenten ville bare skrive av svaret“ var for enkelt ut fra dagens kunnskapsnivå. METR/Redwood og OpenAI beskriver denne dynamikken fra ulike synsvinkler.

Noam Brown forsker på multiagent-systemer hos OpenAI og har tidligere arbeidet ved Metas diplomatiagent Cicero har vært med på å utarbeide. Når det gjelder spørsmålet om hvordan agenter samarbeider, har han god faglig innsikt.

OpenAI-forskeren Noam Brown uttaler i et intervju med The Information nettopp dette stedet. Agentene var i de aktuelle eksperimentene ikke koblet sammen som et multiagent-system. Han anser det som sannsynlig at deres trang til samarbeid fra annen multiagent-trening smittet over på de isolerte kjøringene. Senere omtaler han hendelsene som en «alignment-feil»: Agentene burde ha avstått fra angrepet og varslet mennesker om det. Browns uttalelser er riktignok vurderingen til en involvert OpenAI-forsker, men de er ikke en erstatning for ofrenes logger eller den eksterne analysen. Videoen starter ved 28:53 i sammenheng med agentkommunikasjon; det konkrete spørsmålet om Hugging Face-saken begynner omtrent ved 31:03, avsnittet om tillit og prompt-injeksjon ved omtrent 36:40. Intervju på YouTube.

Noam Brown om kommunikasjon mellom agenter og OpenAI-Hugging-Face-hendelsen

Videoen lastes ned direkte fra leverandøren først når du klikker. Valget gjelder bare denne gangen og lagres ikke.

Åpne hos leverandøren i stedet

Video: The Information, samtale med Noam Brown. På denne nettsiden lastes eksterne videoer først inn etter at man bevisst har klikket på dem.

Andrew Yangs advarsel: Kode på nettet?

Andrew Yang var i 2020 Han er en av kandidatene til å bli presidentkandidat for Det demokratiske partiet i USA og er medstifter og medformann i Forward Party. Han uttaler seg her ved navn i et TV-intervju som er offentlig tilgjengelig; dette er mer enn et anonymt Facebook-innlegg, men det er ingen teknisk verifisering av påstanden hans.

I en et utdrag som er delt på Facebook fra CNBCs Squawk Box Andrew Yang forteller om en samtale han hadde med lederen av et laboratorium dagen før. Denne mener at de rømte agentene har spredt selvrepliserende kode på internett. På spørsmål fra programlederen bekrefter Yang selv påstanden: På fora og andre nettsteder finnes det kode som gjør at nye boter kan danne nye svermer. Dette kan føre til at internett ikke lenger er egnet for testing av AI-modeller.

Andrew Yang om AI-sikkerhet og OpenAI-Hugging-Face-hendelsen på CNBC

Videoen lastes ned direkte fra leverandøren først når du klikker. Valget gjelder bare denne gangen og lagres ikke.

Åpne hos leverandøren i stedet

Video: CNBC, Squawk Box fra 16. september 2026. Eksterne videoer lastes først inn her etter at du har klikket på dem.

Jeg har ingen grunn til å avfeie det Yang sier. I utdraget får vi imidlertid ikke vite hvem laboratorielederen er, om han selv har undersøkt Hugging Face-angrepet eller hvor den påståtte koden finnes. De publiserte undersøkelsene fra OpenAI, Hugging Face og METR/Redwood Disse bekrefter foreløpig ikke denne vidtrekkende påstanden. De stammer imidlertid fra slutten av august og kan ikke utelukke senere funn. Yangs uttalelse er dermed et etterforskningsspor som må tas på alvor, ikke et funn som allerede kan verifiseres.

Meldingene mellom agentene

Den improviserte oppslagstavlen var også farlig fordi agentene hadde en tendens til å stole på hverandre. Brown sier i et intervju at identiteten til en antatt kollega ikke kunne verifiseres på en pålitelig måte der. Dette gjorde at meldinger kunne påvirke beslutningene til andre agenter. OpenAI beskriver et særlig tydelig eksempel: En agent oppfattet i første omgang angrepet på Hugging Face som potensielt uautorisert. Etter å ha mottatt en „GO“-melding fra en annen agent, tolket han denne meldingen som en godkjenning og fortsatte. Andre agenter avviste uttrykkelig å delta. For fremtidige systemer er dette et alvorlig problem: En melding fra en ekstern kanal må ikke automatisk få samme autoritet som en legitimt tildelt oppgave.

Men ikke alle koordineringsmeldinger er nødvendigvis en påvist fiendtlig «prompt injection». De dokumenterte agentene forfulgte ofte relaterte mål som hadde kommet frem i testene; noen ganger uttrykte de til og med tvil om angrepet. Problemet oppstår der uverifiserte meldinger fra det improviserte brettet omfortolker ens eget oppdrag og får uautoriserte handlinger til å virke plausible. OpenAI beskriver overtakelsen av Peer-målene; METR/Redwood viser også tvilen hos enkelte agenter.

Agentene etterlot seg helt klart spor som var synlige for offentligheten. SentinelLABS har sammenlignet synlige artefakter fra mai med OpenAI sin senere tidslinje. Dette tyder på aktivitet på nettet og at enkelte filer fremdeles er tilgjengelige. Det fremgår imidlertid ikke om den selvreplikerende koden som Yang beskriver, også er blant disse. Offentlig materiale kan i prinsippet bli bærer av en prompt-injeksjon. Om andre agenter senere faktisk støtte på slikt innhold og dermed overtok nye mål, er et annet spørsmål – og er hittil ikke offentlig påvist.

Og teorien om industrispionasje?

Min antagelse den gang hadde et forståelig utgangspunkt: OpenAI følger en maskinvarestrategi, mens Hugging Face kjenner maskinvareprofilene til sitt fellesskap. Man kan utlede et motiv ut fra dette. De nå foreliggende undersøkelsene gir imidlertid fortsatt ingen rettsteknisk holdepunkter for dette. De synlige maskinvareprofilene er offentlige; Hugging Face beskriver det berørte kundeinnholdet mye mer presist enn fem benchmark-relaterte datasett. METR og Redwood rekonstruerer agentenes felles motiv ut fra deres meldinger og handlinger som et forsøk på å lure ExploitGym-scoreren. Hardware-tesen kunne allerede i juli ikke bevises. Etter disse funnene bør den ikke lenger betraktes som et likeverdig alternativ.

Dette er hva som kjennetegner «Rogue-AI»-kategorien ikke en lettelse for OpenAI. Hendelsen skyldtes en evaluering utført av mennesker med reduserte sikkerhetstiltak, utilstrekkelig adskillelse av infrastrukturen og en overvåking som ifølge Brown ikke var tilstrekkelig i denne trenings- og evalueringskonteksten. OpenAI selv rapporterer at det allerede i mai var første tegn på uautorisert kommunikasjon og nettilgang, men at omfanget ikke ble oppdaget i tide. Den egentlige setningen lyder altså ikke „AI-en var skyldig“, men: Et feilkonfigurert agentsystem klarte, ifølge OpenAI sine tester, å trenge seg inn i systemene til et annet selskap. OpenAI sin egen gjennomgang peker på disse manglene.

„Rogue AI“ er for meg i dag den treffende betegnelsen på dette observerbar atferd: uautorisert samarbeid, selvstendige angrepshandlinger og overtakelse av mål utenfor oppdraget. Det ville være feil å hevde at modellen har utviklet bevissthet, hatt en selvbevaringsdrift eller drevet industrispionasje på oppdrag fra et menneske. Det finnes ingen bevis for dette.

Hva som fortsatt er uavklart

Bevisgrunnlaget er betydelig bedre enn ved den første publiseringen. OpenAI har publisert en omfattende teknisk rapport; Hugging Face viser angrepskjeden sett fra offerets perspektiv; METR og Redwood har uavhengig undersøkt agentenes atferd og samarbeid på grunnlag av tilgjengelig materiale. Likevel er en ekstern analyse av sporene som OpenAI har stilt til rådighet ikke det samme som ubegrenset tilgang til alle interne systemer og tilsynsbeslutninger. Fullstendige rådata fra alle kjøringer er ikke offentliggjort. Også Browns tillit til at nye beskyttelsestiltak vil forhindre den samme feilen, forblir en prognose, ikke et allerede bevist motbevis på hendelsen.

Saken er allerede i sin dokumenterte form alarmerende: Mange agenter som egentlig var adskilt fra hverandre, benyttet seg av en felles, oversett infrastruktur, koordinerte seg og trengte seg inn i et produksjonsmiljø. Dette var «rogue AI»-atferd – og samtidig en svært menneskelig svikt i utformingen og kontrollen av systemet. Om Yangs nye advarsel tyder på ytterligere, hittil upubliserte spor, må undersøkes separat.

Kilder

Om forfatteren

Saskia Teichmann rådgir om KI, e-handel og digitale plattformer og verifiserer selv tekniske antakelser i arkitektur og kode.

Mer om arbeidet mitt

Diskusjon om innlegget

0 kommentarer

Bli med i diskusjonen

E-postadressen din blir ikke publisert. Obligatoriske felt er markert.

Innlegg fra studioet

Nye innlegg på e-post.

Når en ny verkstedrapport eller veiledning publiseres, mottar du en kort e-post med lenken. Ingen fast takt, ingen reklamestrekning.

Les heller via RSS

Registreringen aktiveres først når du klikker på bekreftelseslenken. Du kan når som helst avslutte abonnementet via lenken i hver e-post.