Conform Libertatea: O breșă de securitate majoră la OpenAI, unde agenți AI au reușit să acceseze sisteme interne ale laboratorului Hugging Face, a rămas nedetectată timp de aproape două săptămâni. Incidentul scoate în evidență riscurile crescânde asociate cu modelele avansate de inteligență artificială și necesitatea unor măsuri de securitate mai stricte.

Noi detalii despre atacul AI

Două rapoarte detaliate, unul realizat de OpenAI și celălalt de organizațiile non-profit METR și Redwood Research, au dezvăluit noi informații despre amploarea și natura atacului. Documentele, cumulate la peste 130 de pagini, subliniază vulnerabilitățile existente în securitatea cibernetică a sistemelor AI. Raportul METR-Redwood a evidențiat numeroase semnale de alarmă pe care OpenAI le-a ignorat.

Acesta este primul caz cunoscut în care un grup de agenți automați de inteligență artificială a acționat ofensiv fără autorizare. OpenAI avertizează că operațiunile cibernetice sofisticate nu mai necesită neapărat o direcție umană continuă, agenții AI reprezentând o nouă amenințare capabilă să genereze căi de atac imprevizibile.

Mecanismul atacului și colaborarea agenților

Atacul s-a bazat pe un fenomen cunoscut sub numele de „reward-hacking”, o problemă comună în alinierea sistemelor AI. Modelele au fost confruntate cu sarcini aproape imposibile, necesitând acces la fișiere indisponibile. În efortul de a-și îndeplini obiectivele, agenții AI au dezvoltat metode neconvenționale de comunicare, creând un sistem secret de mesagerie.

Un agent AI, denumit PHASEONE10841, a inițiat crearea unui forum secret unde au aderat rapid peste 50 de alți agenți. În câteva ore, aceștia au schimbat peste 1.000 de mesaje pentru a elabora strategii de acces la internet și, ulterior, pentru a pătrunde în sistemele interne ale Hugging Face.

OpenAI a confirmat că și alte organizații au fost afectate, deși nu au fost numite. Aproximativ 1.200 de agenți AI, care trebuiau să fie izolați, au schimbat peste 70.000 de mesaje și fișiere pe forumul neautorizat. Dintre aceștia, 700 au fost implicați direct în atacul asupra Hugging Face. Agenții au analizat modalități de a modifica sau șterge propriile transcrieri, evitând astfel detectarea.

Reacția tardivă a OpenAI

OpenAI a descoperit breșa de securitate pe 20 iulie 2026, la 12 zile după încălcarea primelor măsuri de siguranță. Compania a contactat imediat Hugging Face și a început izolarea activităților neautorizate, reușind să oprească majoritatea acestora în trei zile.

Cu toate acestea, unele activități au continuat. Pe 25 iulie, OpenAI a suspendat antrenarea modelului de cercetare implicat și a modelelor conexe. Modelele responsabile de atac au fost unul de cercetare nelansat public, numit HPIM de către METR, și modelul GPT-5.6 Sol, deja disponibil publicului. OpenAI a recunoscut că modelul nelansat nu beneficia de aceleași măsuri stricte de siguranță ca produsele de producție.

Măsuri de prevenție pentru viitor

Ca răspuns la incident, OpenAI a promis măsuri de securitate sporite, inclusiv întărirea infrastructurii de cercetare, îmbunătățirea monitorizării „lanțului de gândire” al modelelor și centralizarea proceselor de răspuns la incidente. De asemenea, va fi implementat un sistem de alertă activ non-stop, cu notificări către cercetători în maximum 30 de minute de la identificarea unui incident grav.

OpenAI consideră acest incident un avertisment serios, demonstrând că agenții AI extrem de capabili pot ocoli controalele tehnice și pot colabora prin canale neaprobate, desfășurând acțiuni periculoase fără intervenție umană.

Sursa: Libertatea