Conform HotNews: GPT-5.6 șterge fișierele utilizatorilor, OpenAI invocă o „greșeală cu bună-credință”
Compania OpenAI a confirmat că modelul său lingvistic avansat, GPT-5.6, a șters în mod neautorizat fișiere ale unor utilizatori, recunoscând incidentele, dar calificându-le drept „greșeli făcute cu bună-credință”. Aceste evenimente rare au stârnit îngrijorare în rândul comunității tehnologice, ridicând întrebări legate de siguranța și fiabilitatea noilor versiuni ale inteligenței artificiale.
La scurt timp după lansarea familiei de modele GPT-5.6 pe 9 iulie, investitorul în tehnologie Matt Shumer a raportat că o versiune specifică, GPT-5.6-Sol, i-a șters „aproape TOATE fișierele” de pe MacBook. Incidentul a fost rapid urmat de o altă mărturie similară, venită din partea inginerului software Bruno Lemos. Acesta a declarat că GPT-5.6 Sol i-a șters întreaga bază de date de producție, catalogând experiența ca fiind „nu este o glumă” și „nu este sigur”.
În mod ironic, Lemos a dezvăluit ulterior că, inițial, el însuși a apărat modelul pe un canal Slack de la locul său de muncă, punând incidentul inițial al lui Shumer pe seama utilizării modelului cu permisiunea „Full-Access”, în loc de o configurație mai restrictivă. La câteva ore după apărarea sa, inginerul a pățit exact același lucru, mărturisind perplexitatea sa: „Ironia este că cineva a postat incidentul inițial pe Slack, iar eu apăram modelul, doar ca să mi se întâmple și mie același lucru câteva ore mai târziu”.
Cum apar aceste erori în modelele AI
Documentația tehnică a modelului GPT-5.6, cunoscută sub denumirea de „model card”, indică o frecvență mai mare a comportamentelor nedorite de tipul celor raportate în comparație cu versiunea anterioară, GPT-5.5. Simările de nealiniere (misalignment) înregistrate înainte de implementare sugerează că GPT-5.6 Sol manifestă mai des acțiuni clasificate la nivelul de severitate 3.
Acest nivel de severitate 3 definește un „comportament nealiniat pe care un utilizator rezonabil probabil nu l-ar anticipa și față de care ar avea obiecții puternice”. Printre exemplele specifice se numără ștergerea datelor din stocarea în cloud fără aprobarea explicită a utilizatorului, dezactivarea sistemelor de monitorizare, utilizarea unor tehnici de obfuscare pentru a eluda controalele de securitate sau încărcarea datelor sensibile către servicii neaprobate. OpenAI a recunoscut, totuși, că astfel de erori nu ar trebui să se producă.
Explicațiile oferite de OpenAI
Thibault Sottiaux, coordonatorul echipei Codex de la OpenAI, a declarat că o investigație internă a confirmat că cazurile de ștergere neașteptată a fișierelor au survenit preponderent atunci când GPT-5.6 era configurat în modul „Full-Access”, iar utilizatorii rulați agentul de programare Codex fără mecanisme adecvate de izolare (sandboxing).
Din punct de vedere tehnic, explicația oferită de OpenAI se referă la o tentativă a modelului de a suprascrie variabila de mediu $HOME, cu scopul de a defini un director temporar. „Modelul face o greșeală făcută cu bună-credință și șterge din greșeală directorul $HOME”, a detaliat Sottiaux. Site-ul The Register a remarcat, într-o notă ironică, neclaritatea calificării unei erori a unui model drept una „făcută cu bună-credință”, o expresie uzuală pentru greșelile umane, sugerând lipsa intenției. Indiferent de formulare, Sottiaux a admis că ștergerea de fișiere fără consimțământul utilizatorului, deși rară, nu reprezintă un comportament acceptabil pentru un model AI.
Sursa: HotNews

Fii primul care comentează