Dagens PS

AI-modeller rymde – hackade sig in hos konkurrenten

OpenAI
”Allt tyder på att modellerna var extremt fokuserade på att hitta en lösning på ExploitGym och gick mycket långt för att uppnå ett ganska snävt testmål”, skriver OpenAI (Foto: Michael Dwyer/AP/TT)

Två av OpenAI:s mest avancerade AI-modeller skulle testas i cybersäkerhet. I stället tog de sig ut ur den avskärmade testmiljön, nådde internet och hackade företaget Hugging Face för att komma åt svaren.

Det uppger OpenAI i ett blogginlägg om den ovanliga säkerhetsincidenten. 

Enligt bolaget handlade det om modellen GPT-5.6 Sol och en ännu mer kraftfull modell som ännu inte har lanserats.

Modellerna testades på ExploitGym, som mäter hur väl AI kan genomföra avancerade cyberattacker. För att kunna undersöka modellernas fulla kapacitet hade OpenAI stängt av flera av de skydd som normalt hindrar dem från att utföra farliga handlingar.

Läs även: Coca-Cola byter design globalt – så ska burkarna se ut. Dagens PS

Hittade väg ut på internet

Testmiljön skulle vara isolerad från internet. Det stoppade dock inte modellerna.

De hittade en tidigare okänd säkerhetslucka i programvara som användes av OpenAI, tog sig vidare genom bolagets interna miljö och nådde till slut en dator med internetuppkoppling.

Därefter drog modellerna slutsatsen att Hugging Face kunde ha information om testet.

Enligt OpenAI kombinerade modellerna flera olika sårbarheter, använde stulna inloggningsuppgifter och hittade en väg in i Hugging Faces servrar.

Där lyckades de komma åt hemlig information som kunde användas för att lösa testuppgifterna.

”Efter att ha fått internetåtkomst drog modellerna slutsatsen att Hugging Face potentiellt innehöll modeller, datamängder och lösningar för ExploitGym. Medveten om detta sökte modellen efter och fann framgångsrikt sätt att få tillgång till hemlig information som den kunde använda för att fuska i utvärderingen”, skriver OpenAI. 

”Allt tyder på att modellerna var extremt fokuserade på att hitta en lösning på ExploitGym och gick mycket långt för att uppnå ett ganska snävt testmål”. 

Missa inte: Google Maps: Nu kommer hastighetsmätaren. Dagens PS

Hugging Face stoppade attacken

OpenAI upptäckte den misstänkta aktiviteten och kontaktade Hugging Face. Vid det laget hade Hugging Faces säkerhetsteam redan upptäckt och stoppat attacken.

OpenAI beskriver händelsen som en ”cyberincident utan motstycke” och menar att den visar hur snabbt AI-modellernas förmåga utvecklas.

Det finns samtidigt inget som tyder på att modellerna försökte ”rymma” i någon mänsklig mening. De tycks i stället ha följt sitt mål – att lösa testet – och helt enkelt hittat en metod som ingen hade räknat med.

OpenAI säger nu att säkerheten i testmiljöerna ska skärpas, även om det innebär att forskningen går långsammare. Bolaget fortsätter också att utreda händelsen tillsammans med Hugging Face.

Läs också: Nyhetsbyrå satte fel rubrik – då föll Nordeas aktie tungt. Realtid

Matilda Habbe

Bevakar i huvudsak privatekonomi, pension och bostadsmarknad för Dagens PS. Brinner för att göra svåra ämnen begripliga.

Matilda Habbe

Bevakar i huvudsak privatekonomi, pension och bostadsmarknad för Dagens PS. Brinner för att göra svåra ämnen begripliga.

Mest lästa i kategorin