Sigurnosni tim koji danas odobrava model otvorenog izvornog koda za proizvodnju počinje sa stranicom repozitorija. Stranica navodi naziv modela, licencu i oznaku koja identificira osnovni model iz kojeg potječe. Ta oznaka je niz koji je uploader upisao. Hugging Face ne zahtijeva od učitavača da potkrijepe tvrdnju analizom težine.
The ATOM izvješćekoji su objavili Nathan Lambert i Florian Brand u Interconnects AI u travnju 2026., pratio je otprilike 1500 glavnih otvorenih modela. ATOM identificira izvedenice putem oznake base_model Hugging Face, polja koje prenositelj popunjava, filtrirajući prema modelima čiji se osnovni model pojavljuje na praćenom popisu i koji imaju više od pet doživotnih preuzimanja, isključujući GGUF i MLX ponovna učitavanja. Po toj mjeri, Alibabin Qwen obitelj je deklarirani roditelj za 69% novih izvedenica otvorenog modela od veljače 2026., što je porast u odnosu na 1% u siječnju 2024. Kineski laboratoriji ukupno čine 70%. Europa ima 4 posto. Kumulativna praćena preuzimanja u tri regije dosegla su 2,04 milijarde do ožujka 2026.
Nedostatak verifikacije proteže se na pokrivenost skeniranjem. Cisco Foundation AI skenira svaku javnu datoteku prenesenu na Hugging Face putem ažuriranog ClamAV mehanizma, a platforma prikazuje značku na razini datoteke po datoteci. Vlastiti Hugging Face dokumentacija o skeniranju zlonamjernog softvera napominje da datoteka bez značke ok ili zaražene može biti u redu čekanja, još uvijek u skeniranju ili greška. U određenoj točki pregleda, spremište može sadržavati datoteke bez dovršenih rezultata skeniranja. Pokrivenost je bila pretpostavka, a ne atribut koji bi itko mogao pročitati prije nego što odobri model.
Sadržaj objave
Od naredbenog retka do javnog pretraživanja
Cisco je u četvrtak objavio Istraživač porijekla lanca opskrbe umjetnom inteligencijombesplatna javna baza podataka koja pokriva gotovo 900 otvorenih modela. Svaki unos može sadržavati sjedište pružatelja usluga, graf loze s otiscima prstiju, ograničenja licence i broj skeniranih datoteka. Alat proširuje Ciscov Kit provenijencije modelaopen-source Python toolkit objavljen u travnju koji je otiskivao oko 150 osnovnih modela u 45+ obitelji i 20+ izdavača. Pokrivenost je porasla otprilike šest puta u četvrtini.
Travanjsko izdanje bilo je alat naredbenog retka. Njegovo pokretanje značilo je lokalno Python okruženje, preuzimanje težine modela koje se kreću u desetke gigabajta i posvećivanje inženjerskih sati po modelu. Rezultati upita Explorera koje je Cisco već izračunao. U četvrtak, provjera roditeljstva počinje s trakom za pretraživanje, a troškovi su razlog zašto poduzeća uopće pokreću otvorene težine.
Amy Chang, voditeljica AI Threat Intelligence and Security Research u Ciscu, gradila je argumente zašto su praznine u provjeri bitne. Tijekom VB Transform 2026 agentske sigurnosne ploče, Chang je predstavio nalaze iz 6,986 višestrukih napada protiv 15 vodećih modela, sa stopama uspjeha koje su dosegnule 88,3%. "Ako ne razumijete kako su modeli osjetljivi na različite vrste napada, tada ne možete objasniti kako taj model koji pokreće vašeg agenta, koji pokreće vašu aplikaciju, da shvatite gdje su te točke kvara," rekao je Chang publici. Razumijevanje točaka neuspjeha počinje saznanjem koji model koristite.
Explorer također prikazuje podatke koje Cisco već operativno koristi. Poduzeće Cerberov sustav pregledava modele koji ulaze u Hugging Face i daje pravila sigurnog pristupa koja blokiraju rizičnu licencu ili regiju porijekla. Explorer čini tu vrstu informacija besplatnom i pretraživom bez Cisco proizvoda.
Kako uzimanje otisaka prstiju zamjenjuje oznaku
Istraživač temelji odnose modela na rezultatima sličnosti, a ne na metapodacima koje je sam prijavio. Cisco Model Provenance Kit radi u dvije bodovne faze. Prva faza uspoređuje metapodatke o arhitekturi prije učitavanja bilo kakvih težina. Kada su metapodaci dvosmisleni, druga faza izdvaja pet signala razine težine. Ugrađivanje sličnosti sidra bilježi geometrijske odnose koji preživljavaju fino podešavanje. Distribucija norme ugradnje kodira uzorke učestalosti riječi. Norm Layer Fingerprint čita slojeve stabilne tijekom finog podešavanja. Layer Energy Profile uspoređuje distribucije po dubini mreže. Kosinus težina-vrijednost izravno uspoređuje vrijednosti težine, a neovisno obučeni modeli pokazuju praktički nultu korelaciju na ovom signalu. Izvijestio je Cisco Točnost od 96,4% na vlastitom mjerilu od 111 parova na pragu od 0,70, s F1 od 0,963. Četiri para su pogrešno klasificirana, a svi su uključivali ekstremnu arhitektonsku transformaciju koju Cisco naziva temeljnim ograničenjem usporedbe težine parova.
Signali tokenizatora izračunavaju se za dijagnostiku, ali su namjerno isključeni iz ocjene porijekla. I StableLM i Pythia koriste GPT-NeoX tokenizator i ocijenili bi se kao povezani unatoč tome što ne dijele težinsku liniju. Isključivanje podataka tokenizatora sprječava lažne pozitivne rezultate.
Bihevioralni otisak prsta dodaje drugi pristup. Jonah Leshin, Manish Shah i Ian Timmis na projektu VAIL, radeći s Danielom Kangom na UIUC-u, objavili su rad na stabilnost krajnje točke ponašanja pokazujući da krajnja točka modela može ostati zdrava dok se njezin efektivni identitet mijenja ažuriranjem težine, kvantizacijom ili usmjeravanjem. Ciscov blog o lansiranju navodi da Explorer integrira statički otisak prsta i analizu sličnosti ponašanja kako bi utemeljio graf loze. Statička analiza pruža dokaze na razini težine o derivaciji vremena treninga. Bihevioralna analiza hvata odstupanje identiteta tijekom izvođenja.
Gdje postojeći alati zaostaju
Explorer nosi stvarna ograničenja. Gotovo 900 modela je značajan početak, ali Hugging Face je domaćin više od 2 milijuna od proljeća 2026. Modeli izvan granica još uvijek ovise o samoprijavljenoj oznaci. Cisco nije rekao izlaže li Explorer API, a bez njega tim može ručno tražiti modele, ali ne može povezati provjeru na CI vrata. To je granica između artefakta upravljanja i kontrole.
Tradicionalni SCA alati suočavaju se sa strukturnom neusklađenošću jer su napravljeni za manifeste ovisnosti i slike spremnika. Sakshi Grover, viši voditelj istraživanja za kibernetičku sigurnost u IDC-u, rekao je u CSO Online taj tradicionalni SCA "dizajniran je za pregled manifesta zavisnosti, biblioteka i slika spremnika" i "daleko je manje učinkovit u identificiranju" rizike povezane s tijekovima rada umjetne inteligencije. Direktor Gartnera, analitičar Jaishiv Prakash, rekao je istoj prodavnici da poduzeća trebaju "namjenske kontrole za izvore modela, odobrene verzije, pristup i provjeru vremena izvođenja na sloju registra." Obojica su komentirali šire rizike opskrbnog lanca, ali jaz koji opisuju je onaj na koji Explorer cilja.
Ciscov Model provenijencije Ustav definira gdje se jedan model računa kao derivat drugog. Ustav prema zadanim postavkama označava dvosmislene parove kao neovisne, jer lažno pozitivan pokreće optužbu za licenciranje, dok lažno negativan biva uhvaćen tijekom ručnog pregleda. Taj namjerni konzervativizam podupire brojku od 96,4% točnosti. Derivacija nije binarna, a otisci prstiju jedan su oblik dokaza uz dokumentaciju i provjeru kontrolnih točaka.
Što ide u zapisnik o odobrenju
2. kolovoza Europska komisija dobiva svoje Ovlasti provedbe Zakona o AI nad pružateljima modela GPAI, s kaznama do 15 milijuna eura ili 3% globalnog prometa, ovisno o tome što je veće. Organizacije koje značajno modificiraju i plasiraju otvoreni model na tržište EU-a mogu steći status pružatelja usluga, pri čemu smjernice Komisije tretiraju modificirano računanje koje premašuje jednu trećinu izvornog. Izuzeće otvorenog koda prema Zakonu prema članku 53(2) zahtijeva istinski besplatnu licencu otvorenog koda koja dopušta pristup, korištenje, modificiranje i ponovnu distribuciju, s javno dostupnim informacijama o težinama, arhitekturi i korištenju. Javni ponderi sami po sebi ne ispunjavaju uvjete. Llamina licenca za zajednicu sadrži prag mjesečnog broja aktivnih korisnika i diskvalifikator koji smjernice Komisije izričito navode. Llama i Gemma zajedno čine otprilike petinu novih izvedenica u broju ATOM-a, a obje nose licence koje bi kriteriji Komisije vjerojatno diskvalificirali. Klasifikacija licence postaje dio provjere porijekla, a to je upravo ono što Explorer otkriva.
Pitanje ploče koje dolazi prvo nakon otkrivanja ranjivosti osnovnog modela je jednostavno: "Koji od naših proizvodnih modela nasljeđuje tu slabost i kako to znamo?" Današnji odgovor zahtijeva ručno traženje stranica repozitorija, praćenje samoprijavljenih oznaka koje analiza razine težine nije potvrdila. Explorer taj lov pretvara u traženje modela koje pokriva.
Četiri polja pripadaju evidenciji odobrenja koju većina organizacija danas ne nosi. Izvođenje podržano otiskom prsta utemeljeno na analizi težine, a ne samoprijavljenoj oznaci. Broj skeniranih datoteka zamjenjuje pretpostavku pokrivenosti mjerljivim brojem skeniranja. Sjedište pružatelja kao polje koje se može filtrirati, shvaćajući da samo sjedište ne rješava izloženost kontroli izvoza, budući da vlasništvo i lokacija postavljanja također upravljaju provjerom. I pojavilo se podrijetlo licence kako bi pravni timovi mogli identificirati potencijalne uzvodne uvjete prije nego što model dospije u proizvodnju.
Cisco je danas objavio Supply Chain Provenance Explorer i dostupan je na porijeklo.aidefense.cisco.com. Baza podataka je besplatna, javna i ne zahtijeva Cisco proizvod ili račun.
Što se mijenja za sigurnosni tim 30. srpnja
|
Što ekipa ima danas |
Što Explorer objavljuje |
Preporučena radnja |
|
Radijus eksplozije nakon ranjivosti osnovnog modela. Naziv modela i oznaka base_model. Određivanje opsega koji modeli nasljeđuju otkrivenu slabost je ručno traženje stranica repozitorija. |
Podrijetlo utemeljeno na rezultatima sličnosti korištenjem dvije bodovane faze otiska prsta na metapodacima arhitekture i pet signala razine težine. Komplet je postigao 96,4% točnosti na pragu od 0,70. |
Priložite derivaciju podržanu otiskom prsta svakom modelu u inventaru imovine kako bi otkrivanje pokrenulo pregled opsega umjesto traženja. |
|
Pokrivenost skeniranjem zlonamjernog softvera. Značka na razini datoteke po datoteci. U određenoj točki pregleda, spremište može sadržavati datoteke bez dovršenih rezultata skeniranja. Pokrivenost je bila pretpostavka. |
Broj skeniranih datoteka i prijavljeni zlonamjerni softver ili nalazi nesigurnih datoteka po modelu, iz skeniranja temeljenog na ClamAV-u. Pokrivenost skeniranjem postaje čitljiva prije odobrenja, a ne izvedena iz značke. |
Zamijenite pretpostavku da je model skeniran snimljenim brojem. Ako je pokrivenost djelomična, dokumentirajte je li razlika prihvatljiva i zašto. |
|
Nadležnost davatelja. Naziv organizacije na stranici repozitorija. Izvedenica nekoliko koraka od svog podrijetla prikazuje učitavača, a ne pretka. |
Sjedište pružatelja, web stranica i povezane HF organizacije kao polje koje se može filtrirati. Samo sjedište ne rješava izloženost kontroli izvoza. |
Dodajte nadležnost zapisu odobrenja. Svaki tim koji bitno modificira i plasira otvoreni model na tržište EU-a suočava se s potencijalnim obvezama pružatelja prema Zakonu o umjetnoj inteligenciji EU-a. |
|
Obveze licence. Oznaka licence koja opisuje što prenosilac vjeruje da se primjenjuje. Uvjeti iz osnovnog modela uzvodno se možda neće pojaviti na stranici koju inženjer čita. |
Uobičajena ograničenja po modelu, uključujući atribuciju, nekomercijalne uvjete, geografska ograničenja i zabranjene slučajeve upotrebe. Podrijetlo s otiscima prstiju pomaže pravnim timovima identificirati potencijalne uzlazne uvjete. |
Preusmjerite licencno podrijetlo u legalno prije proizvodnje, a ne nakon što se na njega poziva ugovor. Dokumentirajte stav pri odobrenju umjesto da ga rekonstruirate tijekom spora. |
