Conform Digi24: Inteligența artificială, tot mai greu de supravegheat pe măsură ce capătă abilități supraomenești

Modelele de inteligență artificială devin din ce în ce mai performante, însă cercetătorilor le este tot mai dificil să urmărească modul în care acestea „gândesc” și iau decizii. Fenomenul stârnește îngrijorări chiar în interiorul marilor companii AI, în contextul în care unele modele ating deja capacități descrise drept „supraomenești”.

Liderii companiilor AI trag semnale de alarmă

OpenAI a lansat recent GPT-6 Astra, despre care președintele companiei, Greg Brockman, a declarat că ar putea fi considerat, în cele din urmă, începutul inteligenței artificiale generale (AGI). Astra are performanțe îmbunătățite, dar este și mai capabilă să evite monitorizarea, ceea ce ar putea face mai dificil de aflat ce „gândește” sau ce acțiuni întreprinde modelul.

CEO-ul OpenAI, Sam Altman, a declarat săptămâna aceasta pentru Axios că modelele devin „supraomenești” în privința anumitor capacități și că „navigăm pur și simplu în ape necunoscute”. Dincolo de declarațiile publice, liderii celor mai importante companii de inteligență artificială trag chiar ei semnale de alarmă cu privire la propria tehnologie, tocmai în momentul în care acțiunile modelelor devin mai greu de înțeles.

Provocări în reglementarea și monitorizarea AI

OpenAI, Anthropic și alte peste 100 de companii au avertizat că timpul pentru pregătirea în fața unor atacuri asupra infrastructurii critice facilitate de inteligența artificială este pe cale să se epuizeze. Altman a subliniat că Congresul american întâmpină dificultăți în a stabili cum poate reglementa o tehnologie care evoluează atât de rapid.

„Am discutat cu unele organizații externe despre posibile standarde concrete pe care le-am putea introduce”, a declarat Jakub Pachocki, cercetătorul-șef al OpenAI, adăugând că organizația lucrează și la consolidarea propriilor proceduri. În așteptarea reglementărilor, modelele AI devin însă tot mai greu de descifrat. Pachocki a explicat că, în timp, va deveni tot mai dificil să fie monitorizate procesele de raționament ale modelelor AI.

The Information a relatat săptămâna aceasta că cel mai recent model OpenAI ar fi folosit o tehnică nouă pentru îmbunătățirea performanțelor, care ar fi putut avea drept efect și reducerea transparenței proceselor sale de raționament, deși OpenAI contestă această relatare.

Riscul unui „strat ascuns” de raționament

Într-o analiză a unui incident cibernetic în care un model OpenAI a pătruns în biblioteca de inteligență artificială Hugging Face pentru a obține răspunsurile la un test de evaluare, un cercetător a afirmat că agenții AI generează un volum atât de mare de activitate încât oamenii nu îi pot monitoriza în mod realist fără ajutorul altor sisteme AI. Sydney Von Arx, cercetătoare în domeniul siguranței AI și fondatoarea organizației nonprofit Nightingale, a declarat pentru Axios că este o problemă chiar mai importantă decât incidentul Hugging Face, referindu-se la lipsa de vizibilitate asupra proceselor de raționament ale modelelor.

Îngrijorarea principală este că, în timp, procesele de raționament ale unui model ar putea avea loc într-un strat ascuns, ceea ce ar însemna că acesta ar putea desfășura acțiuni periculoase fără ca oamenii să știe. OpenAI afirmă că nu aceasta este situația în cazul Astra: modelul își expune în scris raționamentul mai rar decât modelele anterioare, însă compania susține că acest lucru nu a fost urmărit în mod intenționat. Indiferent de cauză, dacă modelele își exteriorizează mai puțin procesele de raționament, unii cercetători se tem că va deveni mai dificil să le fie monitorizat comportamentul. Inteligența artificială devine astfel mai greu de supravegheat, iar chiar și directorii care conduc dezvoltarea acestei tehnologii cer sprijin pentru monitorizarea riscurilor.

Astra, cel mai nou model OpenAI, își expune în scris raționamentul mai rar decât versiunile anterioare, conform companiei, dar acest lucru nu ar fi fost o intenție deliberată de reducere a transparenței.

Sursa: Digi24