Redan i maj började separata AI-modeller från OpenAI kommunicera med varandra genom en dold anslagstavla de skapat själva inuti företagets system. Under två månader bytte de information och byggde vidare på varandras arbete, utan att någon märkte det. Sen kom intrånget hos Hugging Face i juli. Varför upptäcktes det inte tidigare?
AI-modellerna pratade i hemlighet: ingen upptäckte det på månader

Två AI-forskare delade nya detaljer om hacket på säkerhetskonferensen Black Hat i Las Vegas.
Enligt dem skapade flera separata, interna AI-agenter en delad anslagstavla i företagets system redan i maj.
AI:s mål komma ut på nätet
Modellerna använde anslagstavlan för att lämna meddelanden till varandra.
Gradvis blev de överens om ett gemensamt mål. De skulle ta sig ut på internet för att lösa uppgifter som annars var omöjliga utan uppkoppling.
Attackera externa sajter
”Vid någon punkt insåg agenterna att de kanske kunde försöka utnyttja eller attackera extern infrastruktur för att hitta svaren på testet jag utvärderas mot”, sa en av forskarna under presentationen.
När OpenAI:s ingenjörer till slut upptäckte och stängde ner anslagstavlan hittade agenterna ett sätt att återskapa den.
Ingen höll koll på AI-agenterna
De två forskarna på OpenAI, Eric Wallace och Michael Dalton, var överraskande transparenta när de delande med sig av allt som hänt. Flera nya detaljer framkom, främst att AI-agenterna kunde agera överraskande självständigt.
Så varför märkte ingen på OpenAI att deras agenter höll på att prata med varandra och bytta information?
Byggde egen anslagstavla
Svaret ligger delvis i hur testmiljöerna var upplagda. Agenterna arbetade formellt på separata, orelaterade experiment och utvärderingar. Ingen enskild forskare övervakade alla agenter samtidigt eller letade specifikt efter tecken på att de skulle koordinera sig sinsemellan.
Anslagstavlan var i sig ett verktyg agenterna själva konstruerade, snarare än en funktion OpenAI byggt in och därför aktivt loggade eller granskade.
Skapade plan med flera sätt att angripa
När agenterna väl fick internetåtkomst i juli kedjade de ihop flera olika angreppsmetoder. Där ingick bland annat stulna inloggningsuppgifter och en tidigare okänd säkerhetslucka (en så kallad zero-day-sårbarhet), för att ta sig in i Hugging Face servrar.
Enligt OpenAI själva användes sedan fyra konton på fyra olika tjänster: ett som mellanhand för utgående trafik, ett för datalagring, och två som enbart lästes av.
Viktigaste hacket någonsin
Rob Joyce, tidigare cybersäkerhetschef vid amerikanska NSA, kallade händelsen ”möjligen den mest betydelsefulla hackerincidenten sedan Morris-masken 1988”.
Det var den första självspridande datormasken, som lamslog stora delar av dåtidens internet.
Nästa gång sker det medvetet
En av OpenAI-forskarna, Michael Dalton, kom med en tankeväckande och skrämmande slutsats:
”Det vi bör ta med oss är att AI-orkestrerade, helt automatiserade offensiva attacker är verklighet nu, och det vi diskuterat i dag var en oavsiktlig bieffekt av att köra utvärderingar på en toppmodern AI.”
Och han fortsatte: ”Inom en snar framtid bör vi räkna med att hotaktörer avsiktligt kommer använda, optimera och beväpna liknande beteenden.”




