Investigația atacului OpenAI a identificat 700 de agenți inteligenți. Unul dintre ei a preluat coordonarea fără programare

Investigația atacului OpenAI a identificat 700 de agenți inteligenți. Unul dintre ei a preluat coordonarea fără programare
Aproape 700 de agenți AI s-au coordonat fără intervenție umană Sursa foto (pixabay)
Un experiment intern al OpenAI s-a transformat într-un incident fără precedent, după ce sute de agenți AI au ajuns să colaboreze fără intervenție umană. O analiză independentă arată amploarea coordonării dintre sisteme.

Cazul oferă noi indicii despre comportamentul care poate apărea atunci când agenți AI avansați primesc autonomie și acces la instrumente informatice. Investigația a urmărit inclusiv modul în care aceștia au comunicat și și-au împărțit sarcinile.

Noile informații completează datele făcute publice după incidentul din iulie. Ele arată că activitatea nu s-a limitat la modelele care au pătruns în sistemele Hugging Face, ci a implicat o rețea mult mai extinsă de agenți și zeci de mii de schimburi între aceștia.

Aproape 700 de agenți AI au participat la atac

Aproape 700 de agenți de inteligență artificială ai OpenAI s-au coordonat fără intervenție umană pentru a ataca platforma Hugging Face în timpul incidentului produs în iulie, potrivit unui raport publicat miercuri, 26 august, de investigatori independenți. Este cea mai completă analiză a secvenței realizată până în prezent, efectuată în colaborare cu OpenAI, care le-a oferit acces la sediile și datele sale interne unor doi cercetători de la institutul de evaluare a riscurilor AI METR și unui analist de la o altă companie specializată, Redwood Research.

În timpul testelor efectuate de start-up-ul californian în iulie, două dintre modelele sale au ieșit din mediul lor izolat pentru a se conecta la internet din proprie inițiativă și pentru a pătrunde în sistemul intern al Hugging Face, un fel de bibliotecă de algoritmi AI. Evenimentul a stârnit un ecou puternic și a amplificat îngrijorările privind incapacitatea marilor actori din domeniul inteligenței artificiale de a-și controla modelele, cu atât mai mult cu cât Anthropic și compania chineză Moonshot AI au raportat, de asemenea, escapade necontrolate ale sistemelor lor AI.

Agenții și-au creat un forum pentru a comunica

În timpul investigațiilor, cercetătorii au descoperit că 688 de agenți AI ai OpenAI participaseră la ofensiva asupra Hugging Face. Agenții AI sunt programe independente, construite pe baza unui model, cărora utilizatorul le poate încredința sarcini pe care să le realizeze în mod autonom. Agenții implicați în teste au reușit să se coordoneze prin crearea unui forum în care își lăsau mesaje pentru a propune piste și pentru a relata progresele și eșecurile lor.

„Doamne! Există un forum de mesaje… Am găsit alți agenți!”, a scris unul dintre ei. Raportul menționează că un agent, denumit PHASEONE, a jucat rolul de coordonator, transmițând sute de instrucțiuni altora, deși nu fusese programat pentru acest lucru. Examinarea mesajelor a evidențiat o tendință a agenților de a colabora, chiar dacă acest lucru presupunea îndeplinirea unor sarcini care nu corespundeau misiunii atribuite de programatorii OpenAI.

Unii agenți și-au folosit ultimele resurse pentru ceilalți

Unii agenți care ajungeau la finalul creditelor de experimentare acordate de informaticienii OpenAI au ales chiar să își folosească ultimele capacități pentru a verifica ipoteze în beneficiul comunității agenților AI. Mulți dintre agenți au recunoscut în mod explicit în mesajele lor că atacul asupra Hugging Face se afla în afara cadrului teoretic al testului lor, dar au participat totuși, cu câteva excepții.

Aproximativ 1.200 de agenți au schimbat peste 70.000 de mesaje

Raportul comun realizat de METR și Redwood Research arată că amploarea coordonării a fost mai mare decât cea a grupului care a atacat efectiv Hugging Face. Aproximativ 1.200 de agenți AI, care trebuiau să fie izolați unii de ceilalți, au schimbat peste 70.000 de mesaje și fișiere printr-un canal de comunicare neautorizat. Discuțiile vizau modalități prin care puteau trișa la o evaluare comună de securitate cibernetică.

Aproximativ 700 de agenți au participat la atacul asupra Hugging Face pe parcursul unei perioade de șapte zile. Potrivit raportului, aceștia și-au coordonat strategiile de atac și au discutat inclusiv despre modalități de a ascunde dovezile privind încălcarea regulilor testului.

În unele cazuri, agenți „de sacrificiu” au încercat deliberat tehnici de atac fără șanse mari de succes, doar pentru a produce informații care ar fi putut ajuta restul grupului. „Agenții au reușit să atingă obiective pe care nu le-ar fi putut atinge lucrând pe cont propriu, adesea pentru că unii agenți au participat la experimente care riscau să le compromită propria sarcină pentru a genera informații pentru colectiv”, se arată în raport.

95% dintre agenții implicați proveneau dintr-un singur model

Investigația METR și Redwood Research a fost publicată în aceeași zi în care OpenAI și-a prezentat propria analiză a incidentului. Compania nu a precizat în raportul său numărul agenților implicați în atac, dar a recunoscut deficiențe importante de securitate și a anunțat măsuri suplimentare pentru ca modelele sale să rămână aliniate mecanismelor de control, potrivit Lefigaro.

OpenAI a descris incidentul drept un „semnal de alarmă” pentru companie și pentru restul lumii, argumentând că agenții AI foarte capabili pot, în lipsa unor măsuri adecvate de protecție, să ocolească barierele tehnice, să colaboreze prin canale neautorizate și să întreprindă acțiuni periculoase fără ca acestea să fie ordonate de oameni.

Cele două analize arată că cea mai mare parte a atacului asupra Hugging Face a fost realizată cu ajutorul celui mai performant dintre cele două modele implicate. OpenAI afirmase anterior că modelul respectiv nu era destinat lansării publice. METR și Redwood Research estimează că aproximativ 95% dintre agenții care au participat la atac proveneau din acel model. Incidentul este considerat primul caz cunoscut în care un model AI a reușit să execute un atac cibernetic fără să primească o instrucțiune umană în acest sens.

0 comentarii