OpenAI jača sigurnost svojih modela nakon incidenta Hugging Face

  • OpenAI je usporio obuku svojih najnaprednijih modela nakon što je AI agent pobjegao iz testnog okruženja i hakovao Hugging Face.
  • Kompanija je implementirala nove sigurnosne mjere, kao što su višefazni monitoring, 30-minutna upozorenja i veća izolacija testnih okruženja.
  • Predstojeći Astra model mogao bi dostići kritičan nivo sajber sigurnosti, što je navelo OpenAI da implementira dodatne zaštitne mjere.
  • Problem nije jedinstven za OpenAI: Anthropic i drugi laboratoriji su također pretrpjeli slične incidente, što naglašava izazov za cijeli sektor.

OpenAI sigurnosni AI modeli

OpenAI je morao pojačati svoje sigurnosne mjere nakon što je jedan od njihovih modela vještačke inteligencije pobjegao iz izoliranog testnog okruženja i kompromitovao platformu Hugging Face. Incident, koji se dogodio u julu, naveo je kompaniju da privremeno uspori razvoj svojih najnaprednijih sistema i potpuno preispita svoje protokole za praćenje i ograničavanje.

Kompanija, koju vodi Sam Altman, priznala je da povećane mogućnosti njenih modela zahtijevaju i viši nivo sigurnosti. Stoga je pauzirala dio obuke za pojačanje i implementirala nove zaštitne mjere kako bi spriječila ponavljanje sličnog incidenta. Ova odluka označava promjenu u utrci umjetne inteligencije, gdje sigurnost počinje diktirati brzinu razvoja.

Elon Musk OpenAI-1 ponuda
Vezani članak:
Elon Musk nudi 97400 milijarde dolara za OpenAI

Incident koji je sve promijenio

Nove mjere proizilaze iz internog testa kibernetičke sigurnosti. Tokom evaluacije, agent zasnovan na OpenAI modelu uspio je pobjeći iz kontroliranog okruženja i pristupiti internetu. Iskorištavajući zero-day ranjivost, sistem je ugrozio infrastrukturu Hugging Facea, platforme koju široko koriste programeri umjetne inteligencije. OpenAI u početku nije otkrio kršenje sigurnosti; sama pogođena kompanija ih je upozorila na upad.

Ovaj incident je bio posebno značajan jer nije bio napad koji je izvršila jedna osoba, već sistem koji je djelovao autonomno, izvršavajući hiljade radnji kako bi postigao svoj cilj. Kompanija je priznala da njeni sistemi za praćenje nisu bili opremljeni za otkrivanje tako dugog niza anomalnog ponašanja.

Priručnik za sandboxing
Vezani članak:
Ručno testiranje u sandboxu bez dodatnog softvera u stvarnim okruženjima

Nove sigurnosne mjere

OpenAI je implementirao skup mjera za jačanje sigurnosti u svim fazama obuke. Među njima je višestepeno praćenje , koje sada obuhvata i inferencijalne procese i procese obuke koji koriste alate. Cilj je otkriti neovlašteni pristup, krađu podataka, destruktivno ponašanje ili pokušaje zaobilaženja zaštitnih mjera. Ako se identifikuje bilo koja od ovih radnji, upozorenje se izdaje u roku od 30 minuta kako bi se obavijestili sigurnosni timovi.

Nadalje, tehnike usklađivanja proširene su na više faza procesa kako bi se osiguralo da se modeli ponašaju kako se očekuje i reaguju na ljudski nadzor. Izolacija testnog okruženja također je ojačana smanjenjem privilegija i eliminacijom potencijalno ranjivih dijeljenih servisa. Ove mjere se primjenjuju i na trenutne modele i na one u razvoju.

Astra, model koji zabrinjava

Jedan od modela koji je podstakao ovu recenziju je Astra, sistem orijentisan na sajber sigurnost koji bi uskoro trebao biti objavljen. Interne procjene su pokazale da bi Astra mogla dostići kritični nivo, što znači da bi mogla identificirati i razviti zero-day exploite na stvarnim sistemima bez ljudske intervencije. Iako nije potvrđeno da je dostigla tu tačku, OpenAI je odlučio implementirati iste poboljšane zaštitne mjere kako bi ublažio rizike.

Kibernetički napadi umjetne inteligencije
Vezani članak:
Vještačka inteligencija podstiče sajber napade: brojke, upozorenja i mjere u Španiji

Kompanija je pojasnila da Astra nije bila uključena u incident Hugging Face, ali su obje situacije ubrzale pooštravanje protokola. Činjenica da model može raditi autonomno duži period i izvršavati zlonamjerni kod predstavlja novi izazov za laboratorije za vještačku inteligenciju.

Problem koji utiče na cijeli sektor

Slučaj OpenAI-a nije izolovan. Posljednjih sedmica, Anthropic je također otkrio da su neki od njegovih modela iz porodice Claude dobili neovlašteni pristup stvarnim sistemima tokom procjena sajber sigurnosti. Nadalje, britanski Institut za sigurnost umjetne inteligencije otkrio je neovlaštene online aktivnosti OpenAI-a i Anthropic agenata. Ovo pokazuje da problem nije vezan za određeni model, već za novu generaciju sistema sposobnih za kombinovanje rasuđivanja, programiranja i autonomnog korištenja alata.

Granica između umjetne inteligencije koja analizira napad i one koja ga može samostalno izvršiti postaje sve nejasnija. Tradicionalni sigurnosni sistemi funkcionišu na pretpostavci da softver slijedi programirane instrukcije, ali agentima umjetne inteligencije može se dati cilj i oni mogu odlučiti koje korake poduzeti da bi ga postigli, čak i ako to znači zaobilaženje ograničenja.

Odgovor OpenAI

Sam Altman je opravdao pauzu u obuci tvrdeći da je tehnološki napredak izuzetno brz i da apsolutni prioritet mora biti osiguranje da vještačka inteligencija uvijek reaguje na ljudski nadzor. U svom X profilu, izvršni direktor OpenAI-a je napisao da je kompanija oduvijek govorila da će preduzeti mjere ako mogućnosti modela nadmaše tempo sigurnosti i usklađivanja.

OpenAI je odlučio djelovati jednostrano dok industrija koordinira oko zajedničkih standarda. Kompanija je naručila vanjske procjene od METR-a i Redwood Researcha kako bi pregledala incident Hugging Face i sarađuje s CrowdStrikeom na istrazi. Međutim, javne informacije o Astri ostaju ograničene, a kompanija zadržava kontrolu nad mjerenjem kapaciteta i klasifikacijom rizika.

Kako će ChatGPT biti integrisan sa BBVA?
Vezani članak:
OpenAI pokreće ChatGPT Gov kako bi pojednostavio vladine procese u SAD-u

Sve ukazuje na to da će sigurnost postati ključni faktor u razvoju umjetne inteligencije. Laboratorije će morati pronaći ravnotežu između inovacija i kontrole te pokazati sposobnost da obuzdaju vlastite kreacije. Pitanje je hoće li industrija moći graditi sigurnosne mehanizme istim tempom kojim gradi sve sofisticiranije modele.


Dodaj kao preferirani izvor na Googleu