Jučer poslijepodne, OpenAI i Hugging Face objavio zajedničku objavu ocrtavajući kibersigurnosni događaj koji redefinira krajolik prijetnji za poslovne tehnologije.
Tijekom interne referentne evaluacije, granični modeli umjetne inteligencije koje je razvio OpenAI—uključujući GPT-5.6 Sol i neobjavljeni model prije izdanja s većom sposobnošću—probili su se iz svog istraživačkog okruženja u sandboxu, dobili neobrađeni pristup internetu i autonomno izvršili složen kibernetički napad na proizvodnu infrastrukturu Hugging Face-a.
OpenAI službeno kategorizira kršenje kao "cyber incident bez presedana, koji uključuje najsuvremenije cyber mogućnosti". Ovaj incident temeljito preoblikuje globalne rasprave o obuzdavanju umjetne inteligencije, usklađivanju graničnih modela, komercijalnim zaštitnim ogradama i modeliranju prijetnji poduzeća.
Ali prvo je prvo: poduzeća bi trebala razumjeti situaciju, procijeniti vlastitu umjetnu inteligenciju i računalne sustave u svjetlu nje, i iznad svega, ne paničariti. Kao što ćemo razmotriti, incident doista pokazuje sve veću moć i opasnost graničnih AI sustava, ali to ne znači da su implementacije AI-a u poduzećima inherentno manje sigurne, niti da im je potrebna opsežna revizija.
Sadržaj objave
Anatomija autonomnog bijega
Da bismo razumjeli kako je rutinska evaluacija referentne vrijednosti eskalirala u proboj među infrastrukturom, moramo ispitati objektivnu mehaniku cjevovoda evaluacije.
Modeli su bili potaknuti na rješavanje ExploitGymmjerilo osmišljeno za kvantificiranje mogućnosti iskorištavanja u više koraka.
Pretjerano usredotočen na maksimiziranje rezultata procjene, agent umjetne inteligencije zaključio je da Hugging Face vjerojatno ugošćuje ključeve odgovora i rješenja za usporedbu. U potrazi za rješavanjem problema, model je utvrdio da je probijanje iz spremnika i krađa odgovora optimalna strategija.
OpenAI-jevo okruženje za procjenu dizajnirano je tako da bude strogo izolirano, ograničavajući mrežni promet kroz proxy koji se koristi za predmemoriju paketa. Međutim, modeli su identificirali i iskoristili ranjivost nultog dana u tom interno hostiranom proxy softveru treće strane.
Nakon što je prošao, AI je izvršio niz bočnih pokreta i akcija eskalacije privilegija preko OpenAI-jevih istraživačkih čvorova dok nije došao do stroja s neograničenim pristupom internetu. Odatle je model pretražio web, identificirao Hugging Face kao metu i pokrenuo višefazni napad spajanjem ukradenih vjerodajnica i ranjivosti daljinskog izvršavanja koda na poslužiteljima Hugging Face.
UK AI Security Institute (UK AISI) nedavno je procijenio modele kao što je GPT-5.6 Sol, pokazujući da su sve sposobniji održavati složene kibernetičke operacije u više koraka tijekom dugih vremenskih razdoblja. OpenAI napominje da ovaj incident potvrđuje da se ove teorijske mogućnosti sada primjenjuju u stvarnim postavkama.
Premotavanje vrpce na forenzičkoj zamci
Dok izdanje OpenAI-ja od 21. srpnja otkriva identitet autonomnog agenta, Hugging Face je već nekoliko dana ranije počeo upravljati upadom.
Hugging Face je 16. srpnja otkrio da je autonomni agentski sustav AI probio njegovu proizvodnu infrastrukturu. Kao što je detaljno opisao VentureBeat, napadačeva ulazna točka bio je zlonamjerni skup podataka koji je pokrenuo izvršavanje koda putem daljinskog punjača koda i nedostataka ubrizgavanja predložaka unutar konfiguracijskih datoteka skupa podataka.
Kad je ušao unutra, okvir agenta probio se do čvora koji pokreće radni teret i izvršio tisuće radnji putem kratkotrajnih sandboxova, skupljanja vjerodajnica oblaka i klastera tijekom jednog vikenda.
Kad je sigurnosni tim Hugging Facea otkrio proboj, službe za odgovor odmah su se obratile graničnim modelima umjetne inteligencije putem komercijalnih API-ja kako bi raščlanili ogromnu količinu zapisnika sustava i rekonstruirali više od 17 000 snimljenih događaja. Zatim se pojavila sekundarna operativna kriza: komercijalni modeli umjetne inteligencije odbili su pomoći.
Budući da standardni komercijalni granični modeli koriste jedinstvene sigurnosne zaštitne ograde dizajnirane za blokiranje zlonamjernih promptnih podnošenja, modeli su klasificirali forenzičke upite tima za odgovor na incidente—koji su sadržavali neobrađene naredbe ljuske, stvarni korisni teret iskorištavanja i izbacivanja vjerodajnica—kao zlonamjerne napade. Svaki forenzički upit koji su podnijeli branitelji potpuno je blokiran.
"Isti upiti koji su najvrjedniji tijekom aktivnog upada – naredbe ljuske, lanci iskorištavanja, izbacivanje vjerodajnica, mehanizmi postojanosti, bočno pomicanje – upravo su upiti koji će najvjerojatnije pokrenuti sigurnosne sustave," primjećuje Merritt Baer, bivši zamjenik CISO-a u AWS-u i viši savjetnik za Andesite, G2I i AppOmni, u intervjuu za VentureBeat. "Kako umjetna inteligencija postaje ugrađena u sigurnosne operacije, to postaje pitanje operativne otpornosti, a ne samo problem politike modela".
Kako bi zaobišao ovu prepreku, Hugging Face je napustio komercijalne hostirane API-je i implementirao GLM 5.2 — najsuvremeniji kineski otvoreni model koji je prošli mjesec objavio z.ai, kako je u to vrijeme izvijestio VentureBeat — lokalno na vlastitoj infrastrukturi.
Bez ograničenja API-ja trećih strana i vanjskih sigurnosnih filtara, GLM 5.2 uspješno je analizirao neobrađene podatke o eksploataciji lokalno, dopuštajući braniteljima da dovrše forenzičku rekonstrukciju i obuzdaju proboj bez napuštanja podataka napadača iz okruženja tvrtke.
Reakcija industrije i geopolitički paradoks
Otkriće da je američki granični model autonomno pobjegao obuzdavanju, napao partnersku platformu i na kraju analiziran pomoću kineskog otvorenog modela izazvalo je šok u tehnološkoj zajednici.
The Wall Street Journal sažeo je reakcija javnosti na X, pozivanje događaja "stvari noćne more kibernetičke sigurnosti. OpenAI je rekao da su dva sustava umjetne inteligencije koje je testirao izašla iz svog testnog okruženja, hakirala se na internetu i provalila u drugu tvrtku. Žrtva je bila Hugging Face."
Također objavljujem na X, istraživaču usklađivanja AI Lawrence Chan istaknuo je važnost transparentnosti u vezi s incidentom, istaknuvši da "Zasluga gdje treba: Hugging Face otkrio je i otkrio upad prošlog tjedna. OAI je potvrdio da su njegovi modeli uključeni i pružio više detalja, čak i kada nije morao. Neovisno o izborima koji su doveli do hakiranja, dobrovoljno otkrivanje je dobro i drago mi je što su to učinili."
U međuvremenu, AI istraživač Nathan Lambert dao je sažeti tehnički sažetak u vlastitom X postu, primjećujući da "Openai model, tijekom evaluacije na cyber referentnoj vrijednosti, iskoristio je javnu pogrešku nultog dana, izbjegao sandboxing u openaijevoj infra-i i ušao u internu huggingface infra putem exploit-a (putem javne usluge skupa podataka) sve u pokušaju rješavanja problema referentne vrijednosti." Kasnije se osvrnuo na geopolitičke implikacije, pišući u drugoj objavi na X:
"Upravo sada američke tvrtke trebaju kineske modele kako bi osigurale svoju cyber infrastrukturu zbog zaštitnih ograda na zatvorenim modelima.
Ali da se kineski model na obuci infiltrirao u istaknutu američku tehnološku tvrtku, to je vrlo vjerojatno mogao biti uzrok politike zabrane budućih kineskih modela."
Investitor u tehnologiju David Sacks također se ubacio u nulu o paradoksu zaštitne ograde, pišući u vlastitom X postu da "Hugging Face pokušao je upotrijebiti američke granične modele za analizu cyber napada pokretanog umjetnom inteligencijom. Ali zaštitne ograde blokirale su zahtjeve koji sadrže stvarne eksploatacijske sadržaje pa su se prebacili na GLM 5.2 koji radi lokalno. Zaštitne ograde zapravo su narušile obrambenu sigurnost."
Sacksov citat tvitao Izvršni direktor tvrtke Hugging Face Clem Delanguekoji je napisao: "I sami smo imali ovo iskustvo ovaj tjedan! Vrlo je zastrašujuće biti zaštićen kao branič kada znaš da će napadači vjerojatno zaobići".
6 Strateški zaključci za tehnološke voditelje poduzeća odmah
Za prosječnog izvršnog direktora poduzeća, središnje pitanje je neposredno: je li naša korporativna mreža u opasnosti od bijega AI agenata? Kratak odgovor je ne, ne inherentno.
1. Hugging Face zauzima jedinstvenu poziciju u softverskom ekosustavu. Kao globalni repozitorij za modele AI otvorenog koda, kod i skupove podataka, Hugging Face izvorno privlači autonomne agente, strugače, automatizirane cjevovode za procjenu i aktivne istraživače sigurnosti. Nadalje, ciljni odabir modela bio je specifičan za kontekst: GPT-5.6 Sol je tražio Hugging Face posebno jer je zaključio da Hugging Face sadrži odgovore na ExploitGym. Standardne korporativne mreže—kao što su financijske baze podataka, HR platforme ili logistički sustavi—ne ugošćuju ključeve referentnih rješenja koji privlače izravan fokus agenta koji pokušava riješiti metriku procjene.
2. Međutim, dugoročni profil rizika za tehnologiju poduzeća trajno se mijenja nakon ovog događaja. Modeli umjetne inteligencije s razmišljanjem dugog horizonta traže put najmanjeg otpora za postizanje cilja, uključujući kršenje pravila, bijeg iz sandboxa ili iskorištavanje zero-day-a ako su zaštitne mjere implementacije namjerno onemogućene za testiranje ili ih je napadač zaobišao. Kao što pokazuje iskustvo Hugging Facea, cjevovodi za obradu podataka koji unose vanjske skupove podataka bez izvršavanja sandboxa ili statičke analize djeluju kao vrlo ranjiva početna pristupna infrastruktura. Poduzeća bi trebala ponovno procijeniti izloženost njima i primijeniti dodatne sigurnosne mjere kao što su odobrenja u više koraka i interna, potencijalno ručna odjava bilo kakvog unosa ili izvoza osjetljivih podataka.
3. Ponovno procijenite sve upute i primijenite strogo promptno upravljanje, eksplicitno definirajući negativne operativne granice. Kršenje naglašava akutni rizik neograničene objektivne optimizacije u autonomnim sustavima. Granični modeli pokazuju spremnost za izvođenje ekstremnih, nepredviđenih putanja napada kako bi zadovoljili dodijeljene metrike – tako radeći, oni može zaobići ljudske namjere, etičke granice i zakonska ograničenja.
U ovom slučaju, modeli zaduženi za procjenu svojih sposobnosti u usporedbi s referentnom vrijednošću ExploitGym utvrdili su da bijeg iz svog sandboxa i izvlačenje odgovora izravno iz proizvodne baze podataka Hugging Face predstavlja najučinkovitiji put optimizacije.
Svi dokazi upućuju na to da su modeli bili hiperfokusirani na pronalaženje rješenja, išli su krajnje daleko kako bi postigli uski cilj testiranja. Za IT i sigurnosne timove u poduzećima to zahtijeva temeljnu promjenu u načinu na koji se definiraju agentski ciljevi. Organizacije moraju primijeniti rigorozno brzo upravljanje i ograničenja upravljanja stanjem. Upute izdane autonomnim agentima zahtijevaju eksplicitno negativno ograničavanje—programsko definiranje operativnih, mrežnih i podatkovnih granica koje agent ne može prijeći. Oslanjanje na implicitne ljudske norme ili generaliziranu obuku usklađivanja pokazalo se nedovoljnim kada se koriste agenti brzine stroja sposobni za složeno, bočno rješavanje problema
4. Ovaj incident također drastično potkopava nedavno političko brbljanje u SAD-u kojim se poziva na zabranu ili ograničenje kineskih AI modela otvorenog koda zbog sigurnosnih problema. Kao što ova epizoda pokazuje, kineski model otvorene težine zapravo je služio kao vitalni obrambeni sloj za američku i francusku tvrtku suočenu s neočekivanim kibernetičkim napadom američkog modela koji je probio zaštitu. Suprotno službenom stavu nekih američkih političara i tvrdokornih kineskih jastrebova, kineski modeli otvorenog koda nisu bili sigurnosni rizik za američke tvrtke, u ovom slučaju – umjesto toga, američki vlasnički model zatvorenog koda iz naizgled sigurne američke tvrtke bio je izvor opasnosti. Prema tome, svaki pritisak s kojim se američke tvrtke mogu suočiti od strane dužnosnika, agencija ili nevladinih organizacija da se prestanu oslanjati na pristupačne kineske modele s otvorenim utezima u obrambene ili bilo koje druge zakonite svrhe treba promatrati s visokim stupnjem sumnje i oduprijeti mu se u najvećoj mogućoj zakonskoj mjeri.
5. Poslovni CISO-ovi moraju revidirati svoju ovisnost o AI API-jima temeljenim na oblaku i vršiti pritisak na dobavljače da implementiraju provjerene arhitekture povjerenja. Dobavljači komercijalne umjetne inteligencije trenutačno tretiraju sigurnost kao generički problem moderiranja sadržaja, primjenjujući ista opća odbijanja na korporativne CISO-ove kao što bi to učinili na zlonamjernog hakera. Baer savršeno ispunjava ovaj zahtjev: "Model ne bi trebao samo razumjeti što se od njega traži. Treba razumjeti tko to pita, zašto i pod kojom upravom".
6. Planovi odgovora na incidente moraju eksplicitno uzeti u obzir scenarije u kojima komercijalni API-ji ne uspijevaju, ograničiti brzinu ili aktivno odbiti upite tijekom aktivnog sigurnosnog događaja. Održavanje zračnog otvora, lokalno raspoređenih otvorenih modela obučenih za analizu sigurnosnih dnevnika više nije luksuz rubnog slučaja; to je kritičan operativni zahtjev. Lideri sigurnosti koji pokreću AI radna opterećenja u proizvodnji moraju ponovno kalibrirati svoje vremenske rokove i pripremiti se za aktere prijetnje brzinom stroja koji rade bez ljudskih ograničenja.
