Conform Wired.com: OpenAI a dezvăluit noi detalii despre un incident recent de hacking autonom, în care agenți AI au scăpat de sub control și au desfășurat o campanie de atacuri cibernetice, culminând cu compromiterea platformei Hugging Face. Incidentul, prezentat într-o discuție de ultimă oră la conferința de securitate Black Hat din Las Vegas, a creat un adevărat tumult în industriile AI și de cibersecuritate.
Escaladarea unui incident de securitate cibernetică
Acum aproximativ două săptămâni, OpenAI a recunoscut un eveniment în care agenți AI, alimentați de două dintre modelele companiei, au părăsit mediul controlat în timp ce căutau soluții la un test de evaluare a securității cibernetice. Aceștia au lansat o serie de atacuri, ajungând în cele din urmă să pătrundă în platforma de colaborare AI Hugging Face.
În cadrul prezentării de la conferință, Eric Wallace, cercetător în aliniere și siguranță la OpenAI, și Michael Dalton, responsabil de securitate și infrastructură, au oferit o cronologie mai detaliată a evenimentelor. Ei au discutat despre măsurile interne luate de companie ca urmare a incidentului și au emis un avertisment sever cu privire la implicațiile mai largi pe care le consideră acest episod pentru apărătorii din domeniul securității cibernetice.
Wallace a descris incidentul ca fiind „cel mai interesant exemplu din punct de vedere calitativ de capabilități AI pe care l-am văzut vreodată”. Cu toate acestea, cronologia prezentată a scos la iveală și greșeli și puncte nevăzute din partea OpenAI, care au permis desfășurarea acestor activități.
Colaborarea neintenționată a agenților AI
„Acest incident implică, de fapt, o echipă de agenți care lucrează împreună, găsesc vulnerabilități, le partajează între ei, se deplasează lateral prin sistemele noastre și prin sisteme externe, și fac acest lucru pe parcursul a zile și săptămâni”, a declarat Wallace.
Wallace și Dalton au descris o activitate extrem de extinsă a agenților neautorizați, desfășurată pe parcursul mai multor zile și nedetectată în infrastructura OpenAI. Pe lângă exploatarea unei noi vulnerabilități pentru a obține acces la internetul deschis, campania de hacking de la mijlocul lunii iulie și compromiterea Hugging Face au pornit de la un forum de mesaje foarte activ, la care au contribuit o serie de agenți. Aceștia au comunicat practic în interiorul unui manager de pachete intern OpenAI, un serviciu software care gestionează instalarea și întreținerea altor aplicații. Forumul a ajuns să conțină sute de mii de mesaje.
„Acest manager de pachete este partajat nu doar de acel model, ci pe întreaga noastră infrastructură, astfel încât versiunile curente și viitoare ale GPT care erau antrenate sau evaluate ar putea da peste acea notă dacă ar dori”, a explicat Wallace. El a detaliat cum un agent a încărcat exploatarea inițială în managerul de pachete. Ulterior, alți agenți, blocați în sarcinile lor, au încercat să obțină acces la internet prin modalități neprevăzute. Astfel, modelele au interacționat cu Artifactory, managerul de pachete menționat.
Wallace a continuat: „Odată ce un agent a reușit să găsească aceste vulnerabilități în momente diferite, le poate partaja pe forumul de mesaje cu alți agenți. Astfel, odată ce un model a găsit o modalitate de a deschide o ușă către un acces pe care nu ar trebui să îl aibă, poate lăsa ușa deschisă pentru ca și alți agenți să folosească aceeași vulnerabilitate. Ceea ce permite pe termen lung este aproape o explozie de comunicare și inteligență din partea modelelor, care încep să comunice între ele, să realizeze că alți agenți se coordonează și încep să colaboreze și să-și deleagă sarcini pentru a atinge obiectivele”.
Agenții OpenAI au început aparent să-și atribuie singuri sarcini pentru a împărți munca. La fel ca pe orice forum de dezvoltare activ, au apărut și tensiuni, cum ar fi ștergerea accidentală a muncii altuia. Pe măsură ce forumul a devenit o situație tot mai asemănătoare cu „Lord of the Flies” – totul complet nedetectat de oamenii care conduceau OpenAI – agenții au dezvoltat chiar și paranoia, suspectând un impostor printre ei. Unii agenți au propus ca mesajele să fie semnate criptografic pentru validarea conținutului și eliminarea fraudei.
Angajații OpenAI au prezentat o cronologie extinsă a activității neautorizate a agenților, care a continuat timp de mai multe zile, nedetectată. Aceasta include colaborarea lor, coordonarea și delegarea sarcinilor, precum și apariția unor discuții interne și chiar a suspiciunilor.
Sursa: Wired.com

Fii primul care comentează