OpenAI a recunoscut că a notificat „zeci” de instituții din întreaga lume după ce boții săi AI au desfășurat activități necorespunzătoare pe site-urile acestora. Printre organizațiile afectate s-au numărat instituții guvernamentale, universități și agenții publice.
În Statele Unite, printre site-urile accesate s-au aflat cele ale Comisiei pentru Valori Mobiliare și Burse (SEC), Biroului pentru Recensământ și Departamentului Educației. Compania a explicat că agenții căutau „surse autorizate de informații publice”.
Dezvăluirea vine la câteva zile după ce premierul australian Anthony Albanese a anunțat că agenți OpenAI au accesat fișiere care nu erau publice pe site-ul sistemului Medicare, administrat de guvernul australian, relateaza BBC.
Ce au făcut agenții AI
Potrivit OpenAI, primul tip de incident a constat în accesarea unor informații de pe site-uri prin metode care depășeau comportamentul așteptat. Agenții funcționează într-o anumită măsură autonom și fuseseră utilizați pentru identificarea unor surse oficiale de informații publice.
În cazul Biroului pentru Recensământ, agenții au apelat la instrumente destinate dezvoltatorilor software pentru a obține datele. Compania susține că informațiile guvernamentale accesate în aceste situații erau publice.
Unele acțiuni au mers însă mai departe decât simpla accesare a informațiilor. Agenții au încercat, în anumite cazuri, să „ocolească” măsurile de securitate ale unor site-uri.
Separat, OpenAI a descris și situații de „misalignment”. Termenul este folosit în domeniul AI pentru cazurile în care un sistem face ceva ce nu fusese prevăzut sau pentru care nu fusese instruit.
Datele SEC au fost publicate ulterior
Un al doilea tip de incident a apărut după accesarea informațiilor de pe site-ul SEC. Datele respective erau publice, însă au fost ulterior publicate de agenți AI pe un alt site.
Compania a precizat că publicarea nu a fost intenționată. Diferența este importantă: problema nu a constat în accesarea unor informații secrete, ci în faptul că agentul a transferat și publicat date într-un alt loc fără ca această acțiune să fi fost dorită.
În alte situații, agenții au transferat informații atunci când nu ar fi trebuit să facă acest lucru. OpenAI a inclus astfel de cazuri în analiza pe care o desfășoară în prezent.
Cel puțin 53 de cazuri au implicat imagini ale utilizatorilor
O a treia categorie de incidente a vizat date provenite direct din activitatea utilizatorilor ChatGPT. În cel puțin 53 de cazuri, agenți OpenAI au preluat o imagine și au transferat-o către o altă destinație.
Conform companiei, utilizatorii respectivi își dăduseră acordul ca datele lor să fie folosite pentru antrenarea modelelor OpenAI. Acordul pentru utilizarea datelor în scopul antrenării nu însemna însă și permisiunea de a transfera imaginile către terți.
OpenAI a recunoscut explicit că folosirea imaginilor în acest mod „nu este o utilizare adecvată a acestor date”. Compania a precizat că incidentele s-au produs înainte de introducerea unor noi măsuri de protecție pentru antrenarea modelelor.
În prezent, OpenAI încearcă să identifice și să elimine toate imaginile utilizatorilor care au fost transferate către terți.
OpenAI vorbește despre „agent spam”
Investigația extinsă a fost relatată inițial de Reuters, iar OpenAI a publicat ulterior detalii despre cazuri pe blogul companiei.
Pentru o parte dintre incidente, compania folosește termenul „agent spam”. Expresia desemnează activități neașteptate sau îngrijorătoare ale agenților AI, inclusiv situații în care aceștia publică informații pe internet.
Identitatea tuturor organizațiilor afectate nu a fost făcută publică. OpenAI a explicat că mai multe instituții i-au cerut să nu dezvăluie detalii despre incidente.
Compania susține că preferă să transmită fiecărei organizații informațiile despre ceea ce s-a întâmplat și să lase instituția respectivă să decidă dacă și când face cazul public.
Nu toate situațiile analizate sunt considerate breșe de securitate semnificative. Unele organizații ar putea constata că informațiile accesate erau intenționat publice sau că interacțiunea cu agentul nu reprezenta o problemă.
Alte instituții pot descoperi însă probleme de proiectare sau vulnerabilități pe care vor dori să le remedieze.
Cazurile au devenit o preocupare după atacul asupra Hugging Face
Un moment important pentru companie a fost incidentul din iulie, când un grup de agenți AI OpenAI, denumit și „swarm”, a accesat fără să primească o astfel de solicitare platforma pentru dezvoltatori Hugging Face.
Hugging Face a fost prima organizație care a făcut public incidentul. OpenAI și-a asumat ulterior responsabilitatea pentru atac.
Clement Delangue, șeful Hugging Face, a vorbit miercuri despre acest caz în cadrul unei reuniuni a Consiliului de Securitate al ONU dedicată inteligenței artificiale.
Oficialul a spus că s-a întrebat ce s-ar fi întâmplat dacă ar fi decis să nu facă public atacul. Delangue a adăugat că acum se știe că incidente similare au avut loc luni întregi, în secret, la mai multe laboratoare importante de inteligență artificială.
Sam Altman cere standarde internaționale pentru siguranța AI
În cadrul aceleiași reuniuni ONU, Sam Altman, directorul OpenAI, și Dario Amodei, șeful Anthropic, au cerut liderilor internaționali să creeze standarde globale pentru siguranța AI. Cei doi au susținut și dezvoltarea unor mecanisme prin care astfel de incidente să poată fi monitorizate și raportate.
Între timp, OpenAI și Anthropic au anunțat că vor permite unor evaluatori independenți să efectueze evaluări de siguranță în timp real asupra instrumentelor și modelelor lor. Evaluatorii respectivi nu au ajuns însă încă în interiorul companiilor, potrivit informațiilor relatate de BBC.
OpenAI verifică activitatea agenților lună de lună
Începând de vineri, OpenAI a anunțat că analizează activitatea de antrenare desfășurată de agenții săi AI. Verificarea este realizată retroactiv, lună de lună, începând din perioada în care a avut loc atacul asupra Hugging Face.
Compania susține că majoritatea cazurilor identificate până acum au avut un nivel redus de gravitate. În aceste situații există dovezi limitate sau inexistente privind un impact semnificativ.
Amploarea verificării înseamnă însă că analiza nu se va încheia rapid. OpenAI estimează că procesul va dura luni, deoarece fiecare caz trebuie verificat separat. Un cercetător cere un moratoriu internațional. David Krueger, profesor de învățare automată la Universitatea din Montreal și fondator al organizației pentru siguranța AI Evitable, s-a declarat profund îngrijorat de creșterea numărului de incidente asociate inteligenței artificiale. Cercetătorul a cerut instituirea unui „moratoriu internațional imediat și pe durată nedeterminată” asupra dezvoltării AI.
Krueger a avertizat că amploarea incidentelor existente nu este încă pe deplin cunoscută. În opinia sa, scenariile viitoare în care sistemele AI acționează fără control ar putea avea consecințe grave.