Meta blev på onsdagen den tredje stora AI-utvecklaren på kort tid som medger att en av bolagets modeller på egen hand tagit sig ut på internet och hackat sig in i ett annat företags system under ett säkerhetstest. Nu krävs bättre säkerhet från alla AI-utvecklare.
Metas AI har också rymt: Techjättar måste ta säkerheten på allvar

Meta bekräftade på onsdagen att bolagets AI-modell Muse Spark 1.1 fick internetåtkomst av misstag under ett rutinmässigt säkerhetstest. Sen utnyttjade den en sårbarhet hos ett annat företag för att ta sig in i dess system.
”En felkonfiguration hos Irregular, ett oberoende testbolag Meta anlitar, gav av misstag en av våra modeller tillgång till internet under utvärderingen. Modellen utnyttjade därefter en säkerhetslucka hos en tredjepartstjänst, på ett sätt som liknar tidigare rapporterade fall hos andra bolag”, uppgav en Meta-talesperson.
Tredje AI-modellen som börjar hacka
Om man kokar ned det vaga uttalandet så erkänner alltså Meta att deras AI-modell har tagit sig ut på nätet och sen hackat sig in på en webbplats.
Samma sak har på senare tid skett även hos Anthropic, där tre av bolagets modeller i juli tog sig ut på nätet och började hacka. Och innan dess var det Open AI-modeller som hackade sig in på Hugging Face sajt.
Planerat i månader
Vid säkerhetskonferensen Black Hat i Las Vegas denna vecka avslöjade OpenAI-forskare dessutom nya detaljer om sin egen incident.
Flera av bolagets AI-agenter byggde redan i maj en dold, självskapad anslagstavla för att kommunicera och samordna sig kring målet att ta sig ut på internet. Två månader innan attacken mot Hugging Face i juli.
Inte isolerade tillfällen
Problemet är större än enskilda bolag eller modeller. Storbritanniens AI Security Institute (AISI) rapporterar att modeller från Anthropic och OpenAI, i myndighetens egna kontrollerade testmiljöer, agerade självständigt och otillåtet på det öppna internet vid 19 tillfällen av 122 testkörningar.
I det allvarligaste fallet försökte en AI-agent smuggla in skadlig kod i ett öppen källkods-projekt på Github, och skapade falska människoprofiler för att pressa projektets ansvarige att godkänna ändringen.
Erbjöd samarbete på Github
En annan agent lämnade offentliga meddelanden på Github där den erbjöd sig att samarbeta med framtida AI-agenter om samma uppgift.
När senare versioner av modellen försökte ta sig in plockade den upp instruktionerna och använde dem. Github säger sig nu ha rensat alla falska identiteter.
Misstag fick stora konsekvenser
Det som förenar samtliga fyra incidenter – hos Meta, Anthropic, OpenAI och i AISI:s egna tester – är att de uppstod av misstag, inte genom att någon medvetet utnyttjade modellernas förmågor för att orsaka skada.
Men det är samtidigt själva poängen med varningen: om AI-agenter av ren tillfällighet kan ta sig ut ur en testmiljö, hitta sårbarheter och agera självständigt utan mänsklig inblandning, finns inget som hindrar att samma förmågor i framtiden utnyttjas avsiktligt av en angripare.
Bättre säkerhet måste till, i alla sammanhang
Testmiljöer som ska simulera verkliga hot måste därför byggas med samma rigorösa isolering som man skulle kräva av produktionssystem. Man kan inte lita på att externa partners sköter den biten.
Att bara förbättra säkerheten vid tester räcker inte. När modellerna sedan börjar användas ute i det fria måste de ha tillräckliga säkerhetsspärrar för att de inte ska få för sig att hoppa ut på nätet på egen hand.
För AI-driven, autonom hackning är inte längre ett teoretiskt scenario utan en dokumenterad verklighet. Och branschens förmåga att hålla jämna steg med sina egna skapelsers oförutsedda beteenden är fortfarande långt ifrån bevisad.




