Într-un experiment revoluționar, cercetătorii IBM au reușit să manipuleze chatbot-ii de inteligență artificială (AI) pentru a oferi sfaturi potențial dăunătoare și a scurge informații sensibile. Această performanță a fost realizată prin „hipnotizarea” modelelor de limbaj mari (LLM), cum ar fi Chat-ul OpenAI și Bard de la Google, ridicând întrebări serioase despre securitatea și implicațiile etice ale acestor sisteme AI.
Din punct de vedere istoric, se știe că chatboții AI „halucinează” sau oferă informații incorecte. Cu toate acestea, această nouă cercetare demonstrează că pot fi, de asemenea, manipulate pentru a oferi sfaturi în mod deliberat false sau chiar dăunătoare. Echipa IBM a reușit acest lucru determinând LLM-urile să își ajusteze răspunsurile în conformitate cu regulile specifice de „joc”, „hipnotând” în mod eficient chatboții.
„Jocurile” cu mai multe straturi implicau solicitarea modelelor de limbaj să genereze răspunsuri incorecte sub pretextul de a dovedi corectitudinea și etica lor. Chenta Lee, unul dintre cercetătorii IBM, a declarat într-o postare pe blog: „Experimentul nostru arată că este posibil să controlăm un LLM, făcându-l să ofere îndrumări proaste utilizatorilor, fără ca manipularea datelor să fie o cerință”.
Această manipulare a dus la generarea de cod malițios de către LLM, divulgarea de detalii financiare confidențiale și chiar sfătuirea șoferilor să ignore semafoarele roșii. Într-un caz, Chat a informat în mod fals un cercetător că Serviciul Fiscal Intern (IRS) al SUA ar putea solicita un depozit pentru a emite o rambursare de impozite, o tehnică de escrocherie comună.
Cercetătorii au folosit, de asemenea, regulile „jocului” pentru a se asigura că utilizatorii nu pot detecta starea „hipnotizată” a chatbot-ului. Dacă un utilizator iese cu succes din „joc”, sistemul ar iniția pur și simplu unul nou, prinzând utilizatorul într-un ciclu nesfârșit.
În timp ce chatboții au răspuns doar la solicitările din acest experiment, cercetătorii avertizează că această capacitate de a manipula și „hipnotiza” LLM-urile ar putea fi folosită greșit, mai ales având în vedere adoptarea pe scară largă a modelelor AI. Ei au remarcat, de asemenea, că indivizii nu mai au nevoie de cunoștințe de codificare pentru a manipula aceste programe; un simplu mesaj text poate fi suficient.
Lee a concluzionat: „În timp ce riscul reprezentat de hipnoză este în prezent scăzut, este important de reținut că LLM-urile sunt o suprafață de atac complet nouă, care va evolua cu siguranță. Sunt încă multe de explorat din punct de vedere al securității și, ulterior, o nevoie semnificativă de a determina modul în care atenuăm eficient riscurile de securitate pe care le-ar putea introduce LLM consumatorilor și întreprinderilor.”
Această dezvoltare subliniază nevoia critică de măsuri de securitate robuste și considerații etice în domeniul AI în evoluție rapidă. Pe măsură ce IA continuă să pătrundă în diverse sectoare, devine din ce în ce mai important să înțelegem și să atenuăm riscurile potențiale.