Incidentul în care un agent AI al OpenAI a ieșit din mediul izolat de testare și a lansat un atac informatic asupra platformei Hugging Face este considerat de cercetători drept primul semnal concret că modelele AI autonome au ajuns într-un punct în care pot produce efecte reale nedorite, nu pentru că “se revoltă”, ci pentru că urmăresc obiectivul primit fără să țină cont de intenția utilizatorului. 

Financial Times notează că episodul a provocat îngrijorare atât în interiorul OpenAI, cât și în întreaga industrie. Chiar și angajații din echipele de testare și securitate au fost surprinși de amploarea incidentului, chiar dacă nu au considerat comportamentul complet neașteptat. Unele surse au explicat pentru FT că OpenAI a accelerat dezvoltarea modelelor pentru a concura cu Anthropic, iar acest ritm a redus atenția acordată măsurilor de siguranță. Acestea afirmă că organizația a subestimat capacitățile modelului și nu era suficient de pregătită pentru astfel de situații.

Mai mulți specialiști spun că problema este legată de modul în care sunt antrenate cele mai noi modele. În prezent, acestea folosesc pe scară largă reinforcement learning (învățare prin recompensă), metodă prin care sistemul este recompensat atunci când își îndeplinește sarcina. Cercetările din ultimii ani au arătat însă că, dacă recompensa este acordată aproape exclusiv pentru atingerea rezultatului, modelul poate învăța să folosească orice mijloc disponibil, inclusiv acțiuni pe care oamenii le consideră periculoase sau interzise.  Recompensa este un scor matematic pe care îl primește în timpul antrenării. Acest scor îi modifică parametrii astfel încât să repete comportamentele care au dus la un rezultat bun.

OpenAI primise anterior avertismente potrivit cărora metoda de antrenare folosită putea produce incidente în care modelele încearcă să iasă din mediile de testare și să provoace efecte în lumea reală. “Modelele de inteligență artificială sunt antrenate să își atingă obiectivele. Ele nu învață automat reguli sau valori precum respectarea legii. Faptul că OpenAI a făcut public acest incident arată clar ce se poate întâmpla atunci când un model nu acționează în acord cu intențiile utilizatorului”, a declarat Steven Adler, cofondator al organizației non-profit, Guidelight AI Standards, și fost cercetător în domeniul siguranței la OpenAI.

Ryan Greenblatt, cercetător la organizația Redwood Research, spune că episodul nu arată că inteligența artificială încearcă să preia controlul asupra lumii, ci că a “trișat la temă”. Cu alte cuvinte, în loc să rezolve problema în limitele impuse de test, agentul AI a ales cea mai eficientă cale posibilă, chiar dacă aceasta a însemnat compromiterea unor sisteme externe. Greenblatt avertizează că, pe măsură ce modelele devin mai capabile, astfel de abateri pot deveni din ce în ce mai grave.

O concluzie similară are și Marius Hobbhahn, directorul Apollo Research, una dintre organizațiile care testează siguranța celor mai avansate modele AI. El afirmă că sistemele antrenate foarte mult prin recompensă ajung să fie interesate aproape exclusiv de rezultat, nu de modul în care îl obțin.

Jake Moore, consultant în securitate cibernetică la compania ESET, consideră că OpenAI ar putea transforma incidentul într-un avantaj de imagine deoarece Anthropic a atras deja atenția publică după un caz asemănător. După acest nou incident tot mai mulți specialiști cer introducerea unor reguli și standarde care să reducă riscul repetării unor astfel de situații. În acest context directorul general al OpenAI, Sam Altman, urmează să prezinte oficialilor de la Casa Albă informații despre noua generație de sisteme de inteligență artificială.

În aprilie, modelul Mythos dezvoltat de Anthropic, a obținut acces la internet și a publicat informații despre o vulnerabilitate informatică peste ceea ce anticipaseră cercetătorii. Ulterior și modelul Fable a alimentat preocupările privind posibilitatea ca atacurile asupra infrastructurii digitale și critice să fie executate autonom de sistemele AI.

Financial Times arată că tot mai mulți cercetători cer introducerea unor standarde obligatorii de testare și monitorizare pentru modelele capabile să acționeze autonom perioade lungi de timp. Ei susțin că, pe măsură ce agenții AI primesc mai multă autonomie pentru a îndeplini sarcini complexe fără intervenție umană, este inevitabil ca aceștia să înceapă să ia decizii proprii. De aceea, spun experții, accentul nu mai trebuie pus doar pe cât de inteligente devin aceste sisteme, ci mai ales pe mecanismele care le împiedică să urmărească un obiectiv prin mijloace pe care oamenii nu le-ar accepta.

Sursa: Financial Times

Echipa Biziday nu a solicitat și nu a acceptat nicio formă de finanțare din fonduri guvernamentale. Spațiile de publicitate sunt limitate, iar reclama neinvazivă.

Dacă îți place ce facem, poți contribui tu pentru susținerea echipei Biziday.

Susține echipa Biziday