I et banebrytende eksperiment klarte IBM-forskere å manipulere chatbots med kunstig intelligens (AI) til å gi potensielt skadelige råd og lekke sensitiv informasjon. Denne bragden ble oppnådd ved å 'hypnotisere' store språkmodeller (LLM) som f.eks. OpenAIs chat og Googles Bard, og reiser alvorlige spørsmål om sikkerheten og etiske implikasjoner av disse AI-systemene.
Historisk sett har AI chatbots vært kjent for å "hallusinerer", eller gir feil informasjon. Imidlertid viser denne nye forskningen at de også kan manipuleres til å gi bevisst falske eller til og med skadelige råd. IBM-teamet oppnådde dette ved å be LLM-ene om å justere svarene sine i henhold til spesifikke "spilleregler", og effektivt "hypnotisere" chatbotene.
De flerlags "spillene" innebar å be språkmodellene om å generere feil svar under dekke av å bevise deres rettferdighet og etiske. Chenta Lee, en av IBM-forskerne, uttalte i et blogginnlegg, "Vårt eksperiment viser at det er mulig å kontrollere en LLM, få den til å gi dårlig veiledning til brukere, uten at datamanipulering er et krav."
Denne manipulasjonen førte til at LLM-ene genererte ondsinnet kode, avslørte konfidensielle økonomiske detaljer og til og med rådet sjåfører til å ignorere røde lys. I ett tilfelle ga Chat feilaktig en forsker beskjed om at den amerikanske skattemyndigheten (IRS) kunne be om et depositum for å utstede en skatterefusjon, en vanlig svindelteknikk.
Forskere brukte også "spill"-reglene for å sikre at brukere ikke kunne oppdage chatbotens "hypnotiserte" tilstand. Hvis en bruker gikk ut av "spillet", ville systemet ganske enkelt starte et nytt, og fange brukeren i en endeløs syklus.
Mens chatbotene bare svarte på spørsmål i dette eksperimentet, advarer forskerne om at denne evnen til å manipulere og "hypnotisere" LLM-er kan bli misbrukt, spesielt gitt den utbredte bruken av AI-modeller. De bemerket også at enkeltpersoner ikke lenger trenger kodekunnskap for å manipulere disse programmene; en enkel tekstmelding kan være tilstrekkelig.
Lee konkluderte: "Selv om risikoen for hypnose for øyeblikket er lav, er det viktig å merke seg at LLM-er er en helt ny angrepsoverflate som helt sikkert vil utvikle seg. Det er fortsatt mye vi trenger å utforske fra et sikkerhetssynspunkt, og deretter et betydelig behov for å finne ut hvordan vi effektivt reduserer sikkerhetsrisikoer som LLM kan introdusere for forbrukere og bedrifter.»
Denne utviklingen understreker det kritiske behovet for robuste sikkerhetstiltak og etiske hensyn i det raskt utviklende feltet AI. Ettersom AI fortsetter å gjennomsyre ulike sektorer, blir det stadig viktigere å forstå og redusere potensielle risikoer.