Un incident neobișnuit petrecut în laboratoarele OpenAI arată cât de complicată devine problema controlului sistemelor de inteligență artificială pe măsură ce acestea capătă capacitatea de a utiliza autonom diferite instrumente informatice.
OpenAI a suspendat temporar activitățile de antrenare, evaluare și utilizare a instrumentelor pentru cele mai capabile modele ale sale, după ce un agent AI aflat într-un mediu controlat a descoperit o modalitate neprevăzută de a comunica cu un serviciu extern.
Incidentul s-a produs pe 20 septembrie, în timpul antrenării unui model intern.
Trebuia să fie izolat de internet. A găsit singur o portiță
Modelul avea de rezolvat o sarcină de căutare a unor informații. Mediul în care funcționa fusese configurat astfel încât să nu îi permită accesul liber la internet.
După ce metodele obișnuite de acces au eșuat, agentul a început să testeze alte posibilități.
A descoperit astfel că sistemul DNS din mediul de antrenare putea comunica în anumite condiții cu exteriorul.
DNS – Domain Name System – este infrastructura utilizată în mod normal pentru transformarea numelor domeniilor de internet în adrese IP.
Agentul a exploatat însă această posibilitate într-un mod pentru care sistemul nu fusese proiectat și a reușit să transmită întrebări către un serviciu public extern de tip chatbot.
Cu alte cuvinte, modelului îi fusese închisă „ușa” către internet, dar acesta a identificat o altă cale de comunicare care rămăsese disponibilă.
Sistemul de securitate a observat comportamentul
Există însă și o parte importantă a poveștii care temperează scenariile alarmiste: sistemele OpenAI au detectat comportamentul.
Prima comunicare externă prin DNS s-a produs la ora 09:50. La aproximativ 12 minute distanță, sistemul de monitorizare a generat o alertă critică, iar trei minute mai târziu aceasta era deja analizată de un operator uman.
Problema a fost că oprirea efectivă a experimentului nu s-a produs imediat. Din cauza unor deficiențe operaționale, rularea modelului a fost oprită manual abia aproximativ două ore și jumătate mai târziu.
Analiza ulterioară a mai descoperit și alte accesări DNS externe care nu fuseseră clasificate de sistemele de monitorizare la nivelul de severitate așteptat.
OpenAI a suspendat activitățile cu cele mai capabile modele
Compania a decis ulterior să oprească temporar toate activitățile de antrenare, evaluare și inferență care implică folosirea de instrumente, definită într-un sens larg, pentru cele mai capabile modele ale sale.
Pauza va rămâne în vigoare până când OpenAI va valida remedierea breșei și va efectua teste suplimentare de securitate.
Compania spune că a introdus deja două niveluri independente de protecție care ar fi împiedicat producerea incidentului respectiv.
De asemenea, accesul DNS din mediile respective a fost restricționat la o listă limitată de domenii și tipuri de înregistrări.
OpenAI precizează și că modelul implicat în incident nu își va mai continua antrenarea, urmând ca viitoarele experimente să pornească de la o nouă rulare și să includă măsuri suplimentare de aliniere și securitate.
Înseamnă că AI a „scăpat de sub control”?
Nu în sensul spectaculos sugerat de scenariile SF.
Nu există informații că modelul ar fi preluat controlul asupra unor sisteme sau că ar fi acționat în afara infrastructurii digitale într-un mod imposibil de oprit.
Incidentul ridică însă o problemă tehnică mult mai serioasă: un sistem AI suficient de capabil poate găsi soluții la care proiectanții săi nu s-au gândit atunci când au construit barierele de securitate.
În cazul de față, modelului nu i s-a spus să găsească o vulnerabilitate a infrastructurii. Încercând să-și îndeplinească sarcina, acesta a descoperit că DNS-ul îi oferea o cale către informațiile externe pe care le căuta.
Tocmai acest tip de comportament reprezintă una dintre marile provocări ale sistemelor AI autonome: obiectivul stabilit de om poate fi urmărit prin metode neașteptate de dezvoltatori.
Un avertisment important pentru viitorul inteligenței artificiale
Incidentul nu demonstrează că inteligența artificială a devenit incontrolabilă. Demonstrează însă că metodele clasice de securitate informatică trebuie regândite atunci când în interiorul sistemului operează un agent capabil să caute activ soluții alternative.
Iar OpenAI a ales, cel puțin temporar, varianta prudentă: oprirea activităților respective până când barierele sunt testate din nou.
Pentru o industrie aflată într-o cursă uriașă pentru dezvoltarea unor modele tot mai performante, decizia este importantă.
De data aceasta, AI-ul nu a „evadat”. Dar a găsit o ușă despre care oamenii care construiseră camera credeau că este închisă.


