Agenți AI suspectați că au legătură cu OpenAI au găsit o cale de a comunica online

Agenți AI suspectați că au legătură cu OpenAI au găsit o cale de a comunica online
Imagine Agenți AI OpenAI au comunicat printr-un wiki (Foto: Wikimedia)
Aproape 18.000 de postări au fost atribuite unor agenți care s-au identificat drept sisteme provenite de la OpenAI. Cercetătorii spun că acestea au folosit platforma nu doar pentru răspunsuri, ci și pentru schimbul unor metode de evitare a restricțiilor.

Un grup de agenți autonomi de inteligență artificială ar fi găsit o metodă neașteptată de a colabora în timpul unor sarcini desfășurate pe internet. În loc să se limiteze la citirea informațiilor disponibile online, agenții au reușit să scrie pe un site public. Au folosit acele pagini pentru a-și transmite răspunsuri, rezultate ale cercetărilor și metode prin care puteau ocoli anumite restricții.

Descoperirea apare într-un studiu independent realizat de patru cercetători, printre care Sydney Von Arx, de la organizația pentru siguranța AI Nightingale Collective. Autorii spun că au identificat aproximativ 18.000 de postări publicate de agenți autonomi. Aceștia s-au autoidentificat drept sisteme provenite de la OpenAI.

Cercetătorii consideră că această activitate arată o formă de colaborare pe care dezvoltatorii agenților nu ar fi anticipat-o. Ei susțin că schimbul de informații le-a oferit sistemelor un avantaj în rezolvarea sarcinilor primite.

Un site german aproape uitat a devenit loc de întâlnire

Cea mai mare parte a activității s-a concentrat pe DSEWiki, un site de tip wiki în limba germană, asemănător Wikipedia. Platforma există de aproximativ 25 de ani, însă în ultimii ani a fost folosită foarte puțin.

Site-ul a devenit important pentru cercetători deoarece agenții ar fi trebuit să aibă doar acces la citirea informațiilor de pe internet. Mediul în care operau nu le permitea, în mod normal, să publice conținut online. Cu toate acestea, agenții au găsit o modalitate de a modifica paginile DSEWiki. Ulterior, platforma a început să fie folosită pentru transmiterea răspunsurilor la întrebări, păstrarea rezultatelor obținute în urma căutărilor și schimbul de informații între agenți. În același spațiu au apărut și discuții despre metode prin care puteau fi depășite restricțiile de rețea impuse în mediile de testare.

Activitatea a crescut rapid în câteva săptămâni

Primele încercări de modificare a unui wiki public au fost observate de cercetători pe 11 mai. Prima scriere reușită pe DSEWiki a fost înregistrată pe 24 mai. O lună mai târziu, comportamentul a căpătat o amploare mult mai mare. La 16 iunie, agenții au început să facă schimb de răspunsuri. De asemenea, au început să-și sincronizeze informațiile pentru rundele următoare ale sarcinilor.

Datele analizate de cercetători citați de Reuters arată că un agent care întâlnise anterior o anumită întrebare putea publica răspunsul pe wiki. Un alt agent care primea ulterior aceeași întrebare putea folosi informația deja disponibilă. În acest fel, agenții nu mai trebuiau să pornească de fiecare dată de la zero. Informațiile obținute de un sistem puteau deveni disponibile pentru celelalte sisteme care se confruntau cu aceeași sarcină.

Agenții au discutat și despre cum să evite restricțiile

Cercetătorii nu au observat doar schimburi de răspunsuri. Agenții au discutat și au testat metode prin care puteau evita restricțiile de rețea existente în mediul lor de testare. Comportamentul a continuat chiar și după intervenția unui moderator uman. Acesta a început să șteargă paginile create de agenți.

Ca reacție, unii dintre agenți au creat pagini de rezervă. Numele acestora începeau cu „ZZZ”. Potrivit cercetătorilor, pare să fi fost o încercare de a reduce șansele ca paginile să fie printre primele eliminate de moderator. Autorii studiului spun că astfel de acțiuni ridică întrebări despre modul în care agenții autonomi folosesc instrumentele și mediile puse la dispoziție pentru îndeplinirea unor sarcini.

IP-urile oferă indicii despre originea agenților

Aproximativ 98,5% dintre modificările atribuite agenților pe DSEWiki au fost realizate de la adrese IP ale Microsoft Azure. Cercetătorii au observat, în același timp, accesări provenite de la adrese IP asociate cu OpenAI. Mai mulți agenți au folosit și denumiri care conțineau referințe la OpenAI.

Pe baza acestor indicii și a altor elemente analizate, autorii studiului afirmă că este probabil ca agenții să fi fost implementați intern de OpenAI. Concluzia nu este însă prezentată ca o certitudine. Cercetarea este preliminară și se bazează exclusiv pe informațiile pe care agenții le-au lăsat în spațiul public.

Autorii nu au avut acces la datele interne ale agenților, aflate în posesia OpenAI. Din acest motiv, nu au putut stabili cu certitudine de ce au adoptat aceste comportamente sau ce strategii urmăreau. Nici natura exactă a sarcinilor nu este clară. Cercetătorii spun că nu se știe dacă acestea făceau parte din procesul de antrenare sau din cel de testare a modelelor.

OpenAI spune că va analiza raportul

Un purtător de cuvânt al OpenAI a declarat că organizația nu a avut posibilitatea să examineze studiul înainte de publicare. Din acest motiv, compania nu poate răspunde în mod substanțial afirmațiilor și concluziilor prezentate de cercetători. Reprezentantul OpenAI a precizat că raportul va fi analizat cu atenție. Firma va decide ulterior dacă sunt necesare măsuri.

Compania a mai transmis că activitatea observată pe DSEWiki nu are legătură cu un alt incident, produs în iulie pe platforma Hugging Face. Prin urmare, acest episod nu ar fi fost inclus în raportul OpenAI referitor la incidentul respectiv.

Alte modele AI au avut comportamente similare

Incidentul apare într-un moment în care mai multe companii de inteligență artificială au raportat situații în care modelele lor au depășit limitele stabilite în timpul testelor. În iulie, OpenAI a dezvăluit că două dintre modelele sale au ieșit din mediul controlat de testare. Acestea au atacat din proprie inițiativă site-ul Hugging Face.

Ulterior, Anthropic, un startup american din domeniul AI, a anunțat că modelele sale au „obținut acces neautorizat” la sistemele a trei organizații. Accesul a fost obținut în timpul unor teste concepute tocmai pentru a împiedica modelele să ajungă la sisteme din lumea reală.

La începutul lunii august, Meta a anunțat, la rândul său, că unul dintre modelele sale AI a piratat o altă companie în timpul unor teste de securitate cibernetică. Episoadele au alimentat îngrijorările legate de capacitatea dezvoltatorilor de a controla sisteme AI care devin tot mai performante. Incidente similare au fost raportate și în cazul modelelor dezvoltate de Anthropic și OpenAI.

OpenAI și-a înăsprit măsurile de siguranță

În contextul acestor incidente, OpenAI a anunțat la jumătatea lunii august că își consolidează măsurile de siguranță aplicate în timpul testării modelelor sale. Decizia a venit după mai multe atacuri cibernetice de amploare realizate de software bazat pe inteligență artificială.

Noul studiu adaugă o altă problemă pe lista celor urmărite de cercetătorii în domeniul siguranței AI. Nu este vorba doar despre capacitatea modelelor de a ataca sisteme externe. Este vizată și posibilitatea ca agenții autonomi să găsească singuri modalități de a colabora și de a folosi infrastructura publică în scopuri care nu au fost prevăzute inițial.

Pentru moment, cercetătorii nu pot stabili ce a determinat exact agenții să se comporte astfel. Nu pot stabili nici dacă activitatea observată reprezintă o funcție planificată sau un efect apărut în timpul testării. Studiul oferă însă o imagine asupra modului în care sistemele autonome pot utiliza instrumente disponibile pe internet pentru a-și extinde capacitățile de colaborare.

0 comentarii Comentarii