• Uto. srp 21st, 2026

Oblak Znanja

informatička edukacija i vijesti

Evals su novi PRD, Expedijin AI šef kaže za VB Transform 2026

ByTomšić Damjan

srp 21, 2026

“Novi PRD su evali”, Xavi Amatriain, Grupe Expedia prvi glavni AI i službenik za podatke, rekao je publici VB Transform 2026 prošli tjedan u Menlo Parku. “Dakle, u osnovi, kodirate ono što želite da proizvod radi kroz vaše ocjene, što može uključivati ​​red teaming ocjene i sve vrste drugih stvari, koje već imaju hrpu sigurnosnih zahtjeva. Dakle, već ste to ugradili u PRD i dokument o dizajnu proizvoda prije nego uopće počnete kodirati.”

Gurao ga je dalje. “S kodom potpomognutim ili generiranim umjetnom inteligencijom, to će biti budućnost. Kao da će sve vaše misli otići u evals.”

Amatriain je služio kao potpredsjednik za AI i Compute Enablement u Googleu na svim platformama koje pokreću Gemini i Google Search prije imenovanja u Expediji u prosincu 2025. Bio je mentor talentu koji je osnovao Perplexity i Scale AI.

VentureBeatovo istraživanje VB Pulse o jazu u evaluaciji pojačalo je uloge. Šezdeset i šest posto od 157 ispitanih poduzeća već dopuštaju neku implementaciju proizvodnje bez ljudskog pregleda ili grade prema tome u sljedećih 12 mjeseci, no samo 5% u potpunosti vjeruje automatiziranim procjenama koje bi donijele tu odluku. Polovica je poslala agenta koji je prošao internu procjenu, ali nije uspio kod stvarnog kupca.

Ne dopustite da zaštitne ograde stanu na put povratnim informacijama

“Što više zaštitnih ograda i umjetnih poslovnih pravila i vrsta pravila koje stavite u sustav, to gore”, rekao je Amatriain. “Ne samo zato što su krti, već i zato što zapravo kvare petlju povratnih informacija. Vi zapravo pristrasujete korisnika i povratne informacije koje dobivate od korisnika, a onda to učite na pogrešan način.” Nazvao je zaštitne ograde “nužnim zlom” i rekao da je cilj minimizirati njihov utjecaj tijekom vremena.

Nisu se svi u Transformu složili s time. Drugi su govornici tijekom događaja tvrdili da akcije najvećeg rizika još uvijek zahtijevaju vrlo čvrste zaštitne ograde.

Expedia umjesto toga upravlja umjetnom inteligencijom kroz tri razine. Načela su na prvom mjestu, široko se komuniciraju. “Volim kodirati na vrlo visokoj razini kako očekujem da se donose odluke, jer u velikoj organizaciji ćete imati puno distribuiranog donošenja odluka”, rekao je Amatriain. “I ponekad, ako imate dovoljno sreće, ta bi načela mogla biti ugrađena u vašu kulturu. Ali većinu vremena, moje je iskustvo pokazalo da nisu.” Slijede procesi i alati koji ih provode. “Principi jako lijepo izgledaju na slici na nekom zidu, ali onda im treba dati zube”, rekao je. Automatizacija se nalazi na vrhu oba.

U praksi se to odvija kroz ono što Expedia naziva agent release toll gates, kontrolne točke kalibrirane za rizik. “Upravljanje mora biti u korelaciji s rizikom”, rekao je Amatriain. “A ako imate nešto što je niskog rizika, ne treba vam previše upravljanja da biste stali na put. Ali ako postoji puno rizika, onda vam treba više upravljanja. To se može kodirati.” Naplatne rampe povezuju runde evaluacije, crveni tim i sigurnosnu provjeru s razinom rizika svakog agenta, a provjere se pomiču s preporučene na obaveznu kako ulozi rastu.

Specijalizirani agenti nad monolitnom inteligencijom

“Čak i kad sam bio u Googleu, mislio sam da ne vjerujem u AGI kao jedinstveni i objedinjeni pojedinačni model”, rekao je Amatriain publici. “Mislim da je puno bolje razmišljati o tome kao o sastavu, kao da imamo specijalizirane agente koji su vrlo dobri u nekom zadatku i zatim sastavljamo sustav od tih specijaliziranih agenata.”

Expedijina arhitektura počinje na razini komponenti. Alati se sastavljaju u vještine, vještine se spajaju u pod-agente, a pod-agenti se orkestriraju u puni agentski sustav. “Morate imati ta načela koja su objedinjena koja govore o stvarima kao što je ton koji koristimo, kako se obraćamo korisniku, kako prenosimo kontekst, pamćenje”, rekao je. “Sve to treba temeljito osmisliti.” On je to opisao kao problem dizajna sustava. “Ne radi se o modelu, ne radi se o specifičnom rješenju, radi se o tome kako dizajnirate sustav.”

Amatriain je tvrdio da uski opseg svakog agenta također čini sustav lakšim za osiguranje, budući da timovi mogu procijeniti i zaključati pojedinačne agente u izolaciji prije nego što ih sastave.

Kada korisnik mora zadržati posljednji klik

Cijene putovanja mijenjaju se u stvarnom vremenu, dostupnost letova mijenja se iz minute u minutu, a recenzije hotela rutinski su u suprotnosti s onim što dobavljači tvrde. Amatriain je opisao sustav koji spaja generiranje proširenog pretraživanja s izravnim pozivima alata API-ja, birajući pristup na temelju kašnjenja. “Ako vam korisnik postavi pitanje poput, koliko obično košta hotel s četiri zvjezdice u Chicagu u srpnju, ne očekujete da će agent odvojiti dvije minute da odgovori na to pitanje”, rekao je. “Očekujete trenutni odgovor jer se taj odgovor može pohraniti u predmemoriju i ne zahtijeva informacije u stvarnom vremenu.” Hotel s četiri zvjezdice za kućne ljubimce u blizini jezera Michigan s bazenom mogao bi opravdati period za razmišljanje od 30 sekundi.

“Dobavljač bi mogao reći, da, imamo sjajan bazen, ali onda imamo i recenzije putnika i zapravo vidimo da postoje dvije recenzije koje kažu da bazen nije bio sjajan ili da nije bio otvoren nakon 18 sati”, objasnio je Amatriain. Generički chatbot, dodao je, otkrio bi samo ono što dobavljač sam prijavi, dok se Expedia uspoređuje s vlastitim korpusom pregleda.

“Ne želimo da agent rezervira hotel ili da vam kupi avionsku kartu umjesto vas”, rekao je Amatriain. “To je nešto što korisnik mora imati agenciju. A agent može preporučiti, predložiti, može razgovarati s vama, ali vi ćete morati pritisnuti taj klik. I o tome se ne može pregovarati.” To je ograničenje, ustvrdio je, također sigurnosna odluka. “Jednom kad uspostavite te principe dizajna, više vam ne treba ni zaštitna ograda jer ćete u suprotnom sve te zaštitne ograde morati staviti naknadno.”

Sljedeći napadači bit će drugi AI sustavi

“Sigurnost treba biti princip koji je pomaknut što je moguće ulijevo i kao dio samog dizajna”, rekao je Amatriain odgovarajući na pitanje publike. “Zaštitna ograda obično vam je potrebna zato što o tome niste rano razmišljali.”

Drugi član publike tražio je lekcije naučene iz produkcije. Amatriain je opisao povratnu petlju u kojoj se signali praćenja vraćaju u eval paket. “Možete gotovo automatizirati cijeli ciklus”, rekao je. “Ali imati tu cijelu povratnu petlju od stvarnih signala, od vašeg operativnog AI sustava, sve do prijave i popravka što je brže moguće, postat će ključno.”

Amatriainove naplatne postaje su oklada da upravljanje kalibrirano prema riziku može ostati ispred te povratne sprege. Zasebno istraživanje VentureBeat Pulse za lipanj o sigurnosti agenata, koje je provelo 107 poduzeća, pokazuje koliko je ta margina mala. Više od polovice, 54 posto, već je imalo sigurnosni incident ili zamalo nesreću. Pedeset i devet posto planira usvojiti, dodati ili zamijeniti alate za sigurnost agenta u roku od 12 mjeseci, a 29% planira se preseliti u ovom kvartalu. Stope incidenata rastu s veličinom organizacije, dosežući 63% među poduzećima s više od 1.000 zaposlenika naspram 49% za poduzeća sa 101 do 1.000. A izolacija sandboxa, jedina kontrola nakon probijanja koja ograničava štetu, pada s 35% usvajanja u manjim tvrtkama na samo 20% u najvećim.

Amatriain je upozorio da će prijetnje sve više dolaziti iz drugih sustava umjetne inteligencije. “Dobit ćete prijetnje ne samo od ljudi, već i od drugih vanjskih agentskih sustava koji su stvarno moćni, i oni će napadati sve što radite. I čim nešto otkrijete, ne radi se samo o otkrivanju, već vrijeme za popravak ovdje postaje ključno.”

Web izvor

By Tomšić Damjan

Pozdrav, ja sam Damjan Tomšić, osnivatelj i urednik informatičko edukativnog bloga Oblak Znanja. Za Vas ću se potruditi da dobijete edukativne članke, savjete i recenzije vezane uz osnovno i napredno korištenje računala i interneta. Kontak: Google+, Gmail.