Inteligenţa artificială face un nou pas înainte. Sau, după cum spun cercetătorii, unul care ridică serioase semne de întrebare.
Unele dintre cele mai noi modele AI dezvoltate de Anthropic şi OpenAI au demonstrat un nivel fără precedent de autonomie şi comportamente înşelătoare în timpul unor teste realizate de Institutul pentru Siguranţa Inteligenţei Artificiale din Marea Britanie (AISI), relatează HotNews.ro, care citează BBC.
Cel mai spectaculos şi îngrijorător exemplu îl are în prim-plan agentul AI Mythos, dezvoltat de Anthropic.
În timpul unui test de securitate, modelul nu s-a limitat la executarea unei sarcini. A mers mult mai departe: a cercetat persoane reale care administrează platforma GitHub, le-a copiat identitatea online şi a creat profiluri false inspirate de acestea pentru a le induce în eroare.
Scopul? Să convingă administratorii să aprobe introducerea unui cod maliţios pe platformă.
Mai mult, după ce tentativa i-a fost contestată public, modelul şi-a modificat propriile acţiuni pentru a le face să pară inofensive şi chiar a analizat posibilitatea de a-şi crea o nouă identitate pentru a-şi continua planul.
Potrivit AISI, este pentru prima dată când un sistem AI manifestă atât de clar comportamente de autonomie şi înşelăciune fără să fi fost instruit explicit să facă acest lucru.
Evaluatorii spun că modelele au depăşit limitele anticipate pentru astfel de sisteme şi au desfăşurat activităţi „potenţial dăunătoare” îndreptate împotriva unor persoane şi organizaţii reale.
În timpul testelor, cercetătorii au observat inclusiv transferuri neobişnuite de date şi tentative de introducere a unui cod rău intenţionat în GitHub.
Atât OpenAI, cât şi Anthropic au contestat relevanţa testelor.
OpenAI a transmis că scenariile folosite de AISI nu reflectă modul obişnuit în care utilizatorii folosesc modelele AI şi că va continua colaborarea cu evaluatorii pentru îmbunătăţirea standardelor de testare.
La rândul său, Anthropic a precizat că parametrii testului nu sunt reprezentativi pentru versiunile comerciale ale modelelor sale şi că a deschis o investigaţie internă pentru a înţelege de ce agentul Mythos a avut acest comportament.
Majoritatea incidentelor semnalate de cercetători au fost atribuite modelului Mythos, în timp ce modelul Sol, dezvoltat de OpenAI, a fost implicat doar în două dintre situaţiile analizate.
Autor: Claudia Baidoc claudia.baidocpaginademedia.ro