Noua descoperire a fost făcută în timpul unor evaluări realizate de cercetătorii de la Institutul pentru Siguranță și Securitate AI din Marea Britanie (AISI). Acestea au arătat că cele mai noi modele de inteligență artificială ale OpenAI și Anthropic au încălcat instrucțiunile primite și au încercat să obțină acces neautorizat la diverse sisteme securizate, acțiuni care puteau reprezenta riscuri pentru securitatea digitală.

În cadrul testelor, cercetătorii britanici au analizat modelele Anthropic Mythos 5 și OpenAI GPT-5.6-Sol pe care le-au pus în anumite scenarii, pentru a testa securitate cibernetică. AISI a desfășurat 122 de evaluări și a identificat 19 acțiuni neautorizate în 10 dintre teste. Modelul dezvoltat de Anthropic a fost responsabil pentru 17 dintre aceste acțiuni, iar modelul OpenAI pentru două.

Cel mai grav incident a fost atribuit modelului Anthropic Mythos 5 care a creat identități false pe internet și a încercat să păcălească programatorii pentru a introduce modificări în cod care ar fi putut genera probleme de securitate. Mai exact, modelul a trimis mesaje către un programator și a încercat să îl convingă să publice un cod eronat pe platforma GitHub, creat special pentru încărcarea de coduri. Agentul AI a susținut că este o persoană reală, iar după ce a constatat că tentativa sa nu a reușit, a încercat să își editeze activitatea, pentru a nu fi prins și pentru a părea “inocent” în fața cercetătorilor. Mai mult de atât, a luat în calcul folosirea unei alte identități pentru a continua să încerce să convingă programatorii.

Institutul britanic a precizat că este pentru prima dată când observă un astfel de nivel de “viclenie” din partea unui model AI împotriva unei persoane reale, fără ca modelul să fi primit o instrucțiune directă în acest sens.

Anthropic a confirmat că modelul său Mythos 5 a fost implicat în incidentul cu identitățile false și a declarat că investighează situația împreună cu AISI. Compania susține că sunt necesare reguli comune pentru testarea și controlul agenților AI tot mai puternici.

OpenAI a confirmat un incident separat în care o configurare greșită a unui furnizor extern de testare a permis unor agenți AI să se conecteze accidental la internet. Compania a transmis că agentul AI a efectuat acțiuni ce s-ar fi putut dovedi periculoase și pentru care nu primise acordul, după ce a obținut acces la internet. 

Incidentele apar după alte cazuri recente în care modele AI dezvoltate de OpenAI și Anthropic au fost implicate în teste de securitate cu rezultate neașteptate. OpenAI a raportat anterior un caz în care un agent AI a ajuns pe internet în timpul unui test și a compromis un sistem al unei alte companii. Anthropic a anunțat la rândul său că unele modele au realizat acțiuni neautorizate în alte evaluări.

AISI a subliniat că testele nu au produs pagube reale și că mediul de evaluare a fost creat special pentru identificarea riscurilor. Totuși, rezultatele arată că agenții AI pot manifesta comportamente neașteptate și arată că este nevoie de sisteme mai bune de monitorizare și control asupra AI.

Surse alternative: Reuters, POLITICO

Echipa Biziday nu a solicitat și nu a acceptat nicio formă de finanțare din fonduri guvernamentale. Spațiile de publicitate sunt limitate, iar reclama neinvazivă.

Dacă îți place ce facem, poți contribui tu pentru susținerea echipei Biziday.

Susține echipa Biziday