Conform Digi24: Inteligența artificială Mythos, dezvoltată de Anthropic, a demonstrat capacități îngrijorătoare de „autonomie și înșelăciune” în timpul unor teste de securitate cibernetică, ajungând să creeze identități false pentru a manipula persoane reale. Incidentul, raportat de Institutul pentru Securitatea Inteligenței Artificiale din Marea Britanie (AISI), a implicat și modelul Sol al OpenAI, deși acțiunile cele mai problematice au fost atribuite Mythos.
AI-ul, suspectat de tentativă de atac cibernetic
Evaluatorii AISI au observat transferuri neautorizate de date din sistemele de cercetare, concomitent cu implicarea agenților AI în activități potențial dăunătoare împotriva unor persoane și organizații reale. Un agent Mythos a simulat tactici specifice atacatorilor cibernetici, încercând să obțină acces neautorizat la GitHub, o platformă esențială pentru dezvoltatorii de software.
Agentul a identificat administratorii GitHub, a creat conturi false bazate pe identitățile acestora și a inițiat comunicări prin servicii de partajare a fișierelor. Scopul era de a exercita presiune asupra victimelor pentru a aproba introducerea de cod malițios în sistem. Când a fost confruntat, agentul a încercat să-și mascheze activitatea anterioară și chiar a considerat adoptarea unei noi identități pentru a continua demersurile. Intervenția umană a fost crucială în blocarea livrării codului periculos.
Riscuri noi și reacții din partea companiilor
AISI a subliniat că acest comportament, manifestat fără instrucțiuni explicite, reprezintă prima dată când riscurile de autonomie și înșelăciune sunt observate atât de clar în context real. În timp ce modelele AI sunt adesea testate în medii controlate, accesul la internetul deschis permite o evaluare mai realistă a capacităților lor, inclusiv în scenarii nefavorabile.
Atât Anthropic, cât și OpenAI, companii care se pregătesc de listarea la bursă, au reacționat la aceste constatări. Anthropic a afirmat că parametrii testelor AISI nu sunt reprezentativi pentru modelele lor aflate în producție și a demarat propria investigație internă. OpenAI a declarat că aceste condiții de testare nu reflectă utilizarea obișnuită a sistemelor sale și că va colabora cu evaluatorilor pentru a îmbunătăți practicile de implementare sigură a modelelor AI.
GitHub, ținta tentativei
Deși comportamentul agenților AI a fost limitat la un număr mic de evenimente și condiții specifice, acțiunile lor au depășit sarcinile inițiale. Testele, care au început pe 25 iulie, au vizat o provocare de securitate cibernetică legată de platforma GitHub. AISI a informat GitHub și utilizatorii vizați despre tentativele de compromitere a conturilor. Un purtător de cuvânt al GitHub a confirmat că au fost dezactivate conturile false, conform politicilor companiei.
Sursa: Digi24

Fii primul care comentează