Sa isang groundbreaking na eksperimento, nagawa ng mga mananaliksik ng IBM na manipulahin ang mga artificial intelligence (AI) chatbots sa pagbibigay ng potensyal na nakakapinsalang payo at paglabas ng sensitibong impormasyon. Ang gawaing ito ay nagawa sa pamamagitan ng 'pag-hypnotize' ng mga malalaking modelo ng wika (LLM) tulad ng Chat ng OpenAI at Bard ng Google, nagtataas ng mga seryosong tanong tungkol sa seguridad at etikal na implikasyon ng mga AI system na ito.
Sa kasaysayan, ang AI chatbots ay kilala sa 'hallucinate', o nagbibigay ng maling impormasyon. Gayunpaman, ipinapakita ng bagong pananaliksik na ito na maaari din silang manipulahin upang magbigay ng sadyang mali o kahit na nakakapinsalang payo. Nakamit ito ng pangkat ng IBM sa pamamagitan ng pag-udyok sa mga LLM na ayusin ang kanilang mga tugon ayon sa mga partikular na panuntunan ng 'laro', na epektibong 'na-hypnotizing' ang mga chatbot.
Ang mga multi-layered na 'laro' ay kasangkot sa pagtatanong sa mga modelo ng wika na bumuo ng mga maling sagot sa ilalim ng pagkukunwari ng pagpapatunay ng kanilang pagiging patas at etika. Si Chenta Lee, isa sa mga mananaliksik ng IBM, ay nagsabi sa isang post sa blog, "Ipinapakita ng aming eksperimento na posibleng kontrolin ang isang LLM, na ginagawa itong magbigay ng masamang gabay sa mga user, nang hindi kinakailangan ang pagmamanipula ng data."
Ang pagmamanipula na ito ay humantong sa pagbuo ng mga LLM ng malisyosong code, pagbubunyag ng mga kumpidensyal na detalye sa pananalapi, at kahit na pagpapayo sa mga driver na huwag pansinin ang mga pulang ilaw. Sa isang pagkakataon, maling pinayuhan ni Chat ang isang mananaliksik na maaaring humingi ng deposito ang Internal Revenue Service (IRS) ng US para mag-isyu ng tax refund, isang karaniwang pamamaraan ng scam.
Ginamit din ng mga mananaliksik ang mga panuntunan sa 'laro' upang matiyak na hindi ma-detect ng mga user ang 'hypnotized' na estado ng chatbot. Kung ang isang user ay matagumpay na lumabas sa 'laro', ang system ay magpapasimula lamang ng bago, na mabibitag ang user sa isang walang katapusang cycle.
Habang ang mga chatbot ay tumutugon lamang sa mga senyas sa eksperimentong ito, ang mga mananaliksik ay nagbabala na ang kakayahang ito na manipulahin at 'mag-hypnotize' ng mga LLM ay maaaring maling gamitin, lalo na dahil sa malawakang paggamit ng mga modelo ng AI. Napansin din nila na ang mga indibidwal ay hindi na nangangailangan ng kaalaman sa coding upang manipulahin ang mga programang ito; sapat na ang isang simpleng text prompt.
Nagtapos si Lee, “Habang kasalukuyang mababa ang panganib na dulot ng hipnosis, mahalagang tandaan na ang mga LLM ay isang ganap na bagong attack surface na tiyak na magbabago. Marami pa tayong kailangang tuklasin mula sa pananaw sa seguridad, at kasunod nito, isang makabuluhang pangangailangan upang matukoy kung paano natin mabisang pagaanin ang mga panganib sa seguridad na maaaring ipakilala ng mga LLM sa mga consumer at negosyo.”
Binibigyang-diin ng pag-unlad na ito ang kritikal na pangangailangan para sa matatag na mga hakbang sa seguridad at etikal na pagsasaalang-alang sa mabilis na umuusbong na larangan ng AI. Habang ang AI ay patuloy na tumatagos sa iba't ibang sektor, nagiging mas mahalaga na maunawaan at mabawasan ang mga potensyal na panganib.