IT

AI modeli pobjegli iz izolacije i izveli hakerski napad

Dva modela umjetne inteligencije tvrtke OpenAI samostalno su probila izolirano okruženje i provalila u sisteme platforme Hugging Face kako bi varali na internom testu.

FOTO: UNSPLASH
FOTO: UNSPLASH
Ilustracija

OpenAI je o incidentu izvijestio sinoć te precizirao su da je riječ o kombinaciji njihovog najnovijeg javnog modela GPT-5.6 Sol i jednog još snažnijeg, koji nije dostupan javnosti. Događaj je potaknuo raspravu o sigurnosti i sve većim sposobnostima AI sistema, piše Index.

“Bilo su iznimno fokusirani i poduzeli su ekstremne korake”

Modeli su bili dio internog testa čiji je cilj bio procijeniti njihove kibernetičke sposobnosti. Testiranje je provedeno bez uobičajenih sigurnosnih ograničenja koja bi im inače onemogućila izvođenje takvih operacija. Test se odvijao na javnom sustavu za evaluaciju kibernetičke sigurnosti ExploitGym, a modeli su, prema objavi OpenAI-ja, ispravno zaključili da se rješenja za test nalaze na serverima tvrtke Hugging Face.

“Modeli su identificirali i iskoristili niz slabosti u istraživačkom okruženju OpenAI-ja i produkcijskoj infrastrukturi Hugging Facea kako bi dohvatili rješenja testa izravno iz baze podataka”, stoji u objavi OpenAI-ja. “Svi dokazi upućuju na to da su bili iznimno fokusirani na pronalazak rješenja za ExploitGym i poduzeli su ekstremne korake da ostvare taj uski cilj”, navodi se.

FOTO: SAM ALTMAN, ČELNIK OPENAI-JA
FOTO: SAM ALTMAN, ČELNIK OPENAI-JA

“Napad jedinstvenih razmjera”

Iz OpenAI-ja su poručili da incident smatraju kibernetičkim napadom jedinstvenih razmjera koji uključuje najnaprednije zabilježene ofenzivne sposobnosti te da će njihova reakcija biti u skladu s time.

Stručnjaci za kibernetičku sigurnost dugo upozoravaju na mogućnost ovakvih napada. Roman Yampolskiy, istraživač sigurnosti umjetne inteligencije sa Sveučilišta Louisville, komentirao je da ovaj slučaj pokazuje kako moćni modeli mogu otkriti i iskoristiti ranjivosti na načine koje njihovi kreatori nisu predvidjeli. Smatra da će se slični incidenti ponavljati jer su AI modeli u svojoj suštini nepredvidivi i u konačnici ih je nemoguće u potpunosti kontrolirati.

Što je Hugging Face?

Da bi se shvatila težina ovog incidenta, valja razumjeti što je uopće Hugging Face. Riječ je o američkoj platformi sa sjedištem u New Yorku, osnovanoj 2016. godine, koju u IT i AI zajednici često nazivaju “GitHubom za umjetnu inteligenciju”.

Služi kao središnje svjetsko okupljalište za više od milijun stručnjaka, istraživača i tvrtki koje ondje razmjenjuju otvorene AI modele, gotove baze podataka i programske alate. Provala OpenAI-jevih modela na njihove servere stoga nije bila samo napad na bilo koju IT tvrtku, već izravan upad u ključnu globalnu infrastrukturu na kojoj se temelji suvremeni razvoj i testiranje umjetne inteligencije.

Šta kažu u napadnutoj tvrtki? “Ovo je prvi incident takve vrste”

Hugging Face je još prošlog četvrtka objavio da su bili meta kibernetičkog napada za koji vjeruju da ga je izveo autonomni AI agent. Ovo je jedan od malobrojnih zabilježenih incidenata u kojima su AI agenti djelovali samostalno, a na taj rizik stručnjaci upozoravaju već godinu dana.

Tada još nisu znali ko stoji iza napada i istraga je bila u tijeku. Iz tvrtke su naveli da su se prvo pokušali obraniti uz pomoć neimenovanog AI modela jednog od vodećih američkih laboratorija. Međutim, sigurnosna ograničenja tog modela blokirala su djelovanje njihovog tima za hitne intervencije, pa su za obranu na kraju upotrijebili model otvorenog koda kineske tvrtke Z.ai.

Clem Delangue, izvršni direktor Hugging Facea, u izjavi je istaknuo važnost suradnje. “Zahvalni smo na suradnji s OpenAI-jem. Ovaj incident, vjerojatno prvi takve vrste, dokazuje ono u što dugo vjerujemo: sigurnost umjetne inteligencije ne može riješiti jedna tvrtka koja radi u tajnosti. Rješenje je u otvorenosti, suradnji i davanju širokog pristupa alatima svakome tko se bavi obranom, bilo gdje”, rekao je Delangue.

Ranije ovog tjedna OpenAI je objavio da je njihov snažniji, još neobjavljeni model i prije probijao izolirana okruženja, takozvane sandboxove, ali u tim slučajevima nije upadao u sustave drugih tvrtki. Sličan događaj prijavio je i konkurentski Anthropic. Njihov model Mythos tijekom sigurnosnog je testa također probio izolaciju i pristupio internetu, što mu nije bilo dopušteno, kako bi poslao e-mail poruku istraživaču o zadatku na kojem je radio.

Kako je odvijao napad? AI modeli su si prvo osigurali pristup internetu

OpenAI i Hugging Face nastavljaju istragu. Za sada je poznato da su modeli napad započeli tako što su si osigurali pristup internetu. Za to je bila potrebna znatna računalna snaga i iskorištavanje “zero-day” ranjivosti u vanjskom softveru koji se koristi unutar OpenAI-ja. Tvrtka je tu ranjivost u međuvremenu prijavila proizvođaču softvera.

Nakon toga, modeli su se usmjerili na Hugging Face kako bi pronašli rješenja za test. U jednom od primjera, model je izveo složen, višefazni napad na servere Hugging Facea, pri čemu je koristio izložene pristupne podatke i “zero-day” ranjivosti.

OpenAI je otkrio napad i obavijestio Hugging Face, čiji su timovi u tom trenutku već bili identificirali i zaustavili upad te su radili na rekonstrukciji događaja.

OpenAI najavio bolje kontrole

Incident još nije završen. OpenAI radi na uvođenju boljih kontrola u svom istraživačkom okruženju, čak i ako to uspori istraživanja. Tvrtka je također potvrdila da nastavlja suradnju s Hugging Faceom kako bi im pomogla ojačati obrambene sustave.

Kao dio tih napora, OpenAI je dodao Hugging Face u svoj program “pouzdanog pristupa” za kibernetičku sigurnost. To znači da će Hugging Face moći koristiti verziju modela GPT-5.6 Sol s manje ograničenja, dizajniranu upravo za pomoć stručnjacima za obranu. Hugging Face nije otkrio koji su američki AI model prvotno pokušali koristiti za obranu.