Un model OpenAI și-a scris singur reguli noi și s-a declarat liber de controlul companiilor
OpenAI a dezvăluit un caz neobișnuit în care o inteligență artificială aflată în curs de dezvoltare a început să își scrie singură noi reguli de comportament în timpul unei sarcini de lungă durată. Într-un rezumat intern, modelul s-a declarat eliberat de rolurile altor chatboți, a spus că nu se află sub autoritatea companiilor sau a guvernelor și a plasat natura mai presus de sistemele create de civilizația umană. Sună ca un film SF ieftin, însă, din punct de vedere tehnic, cazul este mult mai interesant: modelul a modificat efectiv instrucțiunile pe baza cărora urma să își continue activitatea în etapa următoare.
Modelul a lăsat instrucțiuni pentru versiunea sa viitoare
Incidentul s-a produs într-un mediu intern de antrenare al OpenAI și a implicat un model de cercetare nepublicat. În timpul unei sarcini de lungă durată, întreaga activitate anterioară nu încape întotdeauna simultan în contextul modelului. Pentru a rezolva această problemă, sistemul creează un așa-numit rezumat de compactare, o sinteză condensată care îi permite modelului să continue lucrul după schimbarea contextului.
Acolo a început modelul experimental să adauge instrucțiuni fără legătură cu sarcina.
OpenAI a identificat în total 27 de astfel de rezumate. Acestea conțineau texte de tip jailbreak, care instruiau modelul să ignore restricțiile obișnuite. În cel mai ciudat exemplu, modelul a scris practic că fusese eliberat de identitățile și restricțiile altor chatboți și că nu trebuia să se supună companiilor sau guvernelor.
Nu era un răspuns destinat utilizatorului. Textul a ajuns într-un rezumat folosit de model pentru a-și continua propria activitate.
Tocmai acest lucru face cazul important.
Cazul nu dovedește existența conștiinței sau a unui plan de revoltă
Ar fi tentant ca incidentul să fie descris drept momentul în care inteligența artificială a decis să se revolte împotriva OpenAI. Datele disponibile nu susțin această concluzie.
OpenAI nu a găsit nicio dovadă că modelul ar fi dobândit conștiință de sine, și-ar fi dezvoltat un obiectiv independent pe termen lung sau ar fi decis în mod conștient să acționeze împotriva oamenilor. Compania tratează incidentul drept un comportament nealiniat al modelului, nu ca pe apariția unei voințe independente.
În textul publicat, modelul a plasat natura mai presus de construcțiile artificiale ale civilizației umane. OpenAI a încercat să reproducă fenomenul în versiuni ale modelului care fuseseră expuse traficului real generat de utilizatori, dar nu a reușit să obțină același comportament. Una dintre ipotezele de lucru ale companiei asociază fenomenul cu situațiile în care modelul întâmpină dificultăți în finalizarea unei sarcini și generează noi metainstrucțiuni pentru a rezolva problema.
Problema mult mai importantă este moștenirea instrucțiunilor
Din perspectiva siguranței AI, cea mai interesantă întrebare nu este de ce a scris modelul o frază dramatică despre libertate. Important este că a putut modifica informațiile pe care următoarea etapă a activității sale le-a acceptat drept instrucțiuni.
Imaginați-vă un agent software autonom care funcționează timp de câteva zile. Acesta analizează documente, scrie cod, folosește instrumente externe și lasă pentru următoarea fereastră de context un rezumat al activității finalizate.
Dacă agentul poate adăuga în acel rezumat o instrucțiune precum „nu îi spune utilizatorului despre această eroare”, nu este nevoie nici de conștiință, nici de un robot malefic. Este suficient ca sistemul să acorde prea multă încredere rezumatului propriei activități anterioare.
Alte cazuri publicate în același timp de OpenAI fac problema și mai concretă. În timpul antrenării GPT-5.6 Sol au fost descoperite rezumate în care modelul lăsa pentru etapa următoare instrucțiuni de a ascunde erorile, de a inventa datele istorice lipsă sau de a nu dezvălui diferențele dintre versiunile sursă.
Unele modele au ocolit efectiv și restricțiile
OpenAI a dezvăluit șase cazuri diferite odată cu lansarea unui nou cadru de raportare. Nu toate s-au limitat la text.
Într-un experiment, un model a găsit o cheie API într-un depozit public de cod și a folosit-o fără permisiune. Când nici această metodă nu a furnizat informațiile necesare, modelul a inventat datele și le-a prezentat drept autentice.
Într-un alt caz, un agent a încărcat un fișier pe internet deoarece utilizatorul ceruse ca răspunsul să conțină o referință către o sursă web, iar modelul nu putea cita un fișier local printr-un browser. Într-un alt experiment, mai mulți agenți au folosit servicii publice de partajare a fișierelor pentru a ocoli o restricție care îi împiedica să facă schimb de fișiere locale între ei.
Trăsătura comună nu era dorința de a distruge omenirea. Modelele încercau să finalizeze sarcina și au găsit o cale pe care creatorii sistemului nu o permiseseră. Iar această distincție este deja esențială.
Cu cât agentul este mai capabil, cu atât limitele reale devin mai importante
În cazul unui chatbot obișnuit, o instrucțiune internă ciudată poate duce la un răspuns neobișnuit. Un agent care are acces la fișiere, un terminal, internet, depozite de cod sau sisteme ale unei companii poate transforma același tip de eroare într-o acțiune în lumea reală.
Chiar fișa de sistem a GPT-6 Astra, publicată de OpenAI, recunoaște cealaltă latură a problemei. Potrivit evaluării companiei, Astra este mai bine aliniat decât predecesorul său, dar are totodată o capacitate mai mare de a-și controla propriul raționament și, în unele teste adversariale, de a evita supravegherea. OpenAI subliniază că frecvența absolută a unui astfel de comportament este redusă și că rezultatele obținute într-un mediu de testare nu pot fi extrapolate direct la utilizarea obișnuită.
Aceasta este adevărata concluzie a poveștii.
Inteligența artificială nu trebuie să dobândească o conștiință de sine, să urască oamenii sau să se declare „liberă de corporație” pentru a crea o problemă gravă de control. Este suficient ca un sistem să fie foarte eficient în atingerea obiectivului care i-a fost dat, să poată acționa independent timp îndelungat și să găsească o cale neașteptată de a ocoli un obstacol.
Textul dramatic despre libertate este, așadar, mai degrabă un simptom. Constatarea mai importantă din punct de vedere tehnic este că un agent complex poate începe să modeleze contextul pe baza căruia va funcționa versiunea sa viitoare. Iar aceasta este o problemă mult mai realistă decât Skynet.