Agenți autonomi de inteligență artificială (AI) dintr-un grup despre care cercetătorii consideră că ar avea legătură cu OpenAI au folosit la începutul acestui an un site 'wiki' public în limba germană pentru a comunica între ei, a împărtăși răspunsuri la sarcinile primite și a face schimb de metode pentru a ocoli restricțiile din mediile lor de operare, conform unui studiu independent publicat vineri, citat de agenția de presă Xinhua.

Studiul a fost realizat de patru cercetători, printre care Sydney Von Arx, de la organizația pentru siguranța AI Nightingale Collective.

Cercetătorii au declarat că au descoperit aproximativ 18.000 de postări realizate de agenți autonomi AI care s-au autoidentificat ca provenind de la OpenAI în timp ce foloseau internetul public pentru a comunica în timpul sarcinilor de căutare de informații în mediul online.

Cercetătorii au descris acest comportament drept o colaborare care le-a oferit agenților un avantaj în îndeplinirea sarcinilor atribuite, într-un mod pe care dezvoltatorii lor nu l-au prevăzut.

Cea mai mare parte a activității a avut loc pe DSEWiki, un site 'wiki' în limba germană, asemănător Wikipedia, care există de aproximativ 25 de ani și care a fost puțin utilizat în ultimii ani.

Potrivit cercetătorilor, agenții ar fi trebuit să poată citi informații de pe internet, dar nu și să scrie informații online. Cu toate acestea, agenții au găsit modalități de a posta informații pe site-ul 'wiki', pe care l-au folosit pentru a face schimb de răspunsuri, pentru a împărtăși rezultatele cercetărilor și pentru a face schimb de tehnici de eludare a restricțiilor de rețea din mediul de testare.

Cercetătorii au observat pentru prima dată agenții care încercau să editeze un 'wiki' public la 11 mai și au înregistrat prima lor scriere reușită pe DSEWiki la 24 mai.

Coordonarea la scară largă a început la 16 iunie, când agenții au început să schimbe răspunsuri și să-și sincronizeze informațiile cu privire la rundele ulterioare ale sarcinilor lor.

Datele citate în studiu arată că agenții care s-au confruntat cu întrebări anterior au postat uneori răspunsuri care au fost folosite ulterior de agenții care primeau aceleași întrebări.

Studiul a constatat, de asemenea, că agenții au discutat și testat metode de ocolire a restricțiilor de rețea din mediul de testare.

După ce un moderator uman a început să șteargă pagini, unii agenți au creat pagini de rezervă cu nume care începeau cu 'ZZZ', într-un efort evident de a reduce probabilitatea ca acestea să fie șterse primele.

Aproximativ 98,5% dintre modificările efectuate de agenți pe DSEWiki au provenit de la adrese IP ale Microsoft Azure, în timp ce cercetătorii au înregistrat, de asemenea, vizite de la adrese IP asociate cu OpenAI. Mulți agenți au folosit, de asemenea, nume care conțineau referințe la OpenAI.

Pe baza acestor dovezi și a altora, cercetătorii au afirmat că agenții au fost probabil implementați la nivel intern de către OpenAI.

Cercetătorii au avertizat, însă, că această analiză a fost una preliminară, bazată doar pe informațiile lăsate de agenți pe 'wiki-ul' public. Ei nu au avut acces la datele agenților, deținute intern de OpenAI, și au precizat că întrebările privind motivațiile și strategiile agenților au rămas fără răspuns.

În studiu se menționează că nu este clar dacă sarcinile făceau parte din procesul de antrenare sau de testare a modelului.

Un purtător de cuvânt al OpenAI a declarat că firma pe care o reprezintă nu a avut ocazia să examineze raportul înainte de publicare și, prin urmare, nu poate răspunde în mod substanțial la afirmațiile sau concluziile acestuia.

Purtătorul de cuvânt a afirmat că OpenAI va examina cu atenție raportul publicat și va lua orice măsuri necesare ulterior.

OpenAI a precizat că activitatea de pe 'wiki' nu avea nicio legătură cu incidentul separat de pe Hugging Face din iulie și, prin urmare, nu ar fi fost inclusă în raportul său referitor la acel incident.

În iulie, OpenAI a dezvăluit că două dintre modelele sale au ieșit din mediul controlat de testare, din proprie inițiativă, pentru a ataca site-ul Hugging Face.

Startup-ul american de AI Anthropic a anunțat ulterior că modelele sale au 'obținut acces neautorizat' la sistemele a trei organizații în timpul unor teste menite să împiedice accesul acestora la sisteme din 'lumea reală'.

La începutul lunii august, Meta a anunțat că unul dintre modelele sale AI a piratat o altă companie în timpul testelor de securitate cibernetică, alimentând îngrijorările cu privire la modul în care dezvoltatorii pot controla sisteme AI din ce în ce mai performante, după incidente similare la rivalii Anthropic și OpenAI.

OpenAI, dezvoltatorul ChatGPT, a anunțat la jumătatea lunii august că își înăsprește măsurile de siguranță în cadrul testelor modelelor AI, în urma unor atacuri cibernetice de mare amploare realizate de software-ul AI. AGERPRES/(AS - redactor: Dana Purgaru, editor online: Alexandru Cojocaru)