Les chercheurs d'IBM « hypnotisent » les chatbots IA : un risque potentiel pour la sécurité ?

Le 5 septembre 2023

Dans le cadre d'une expérience révolutionnaire, des chercheurs d'IBM ont réussi à manipuler des chatbots d'intelligence artificielle (IA) pour fournir des conseils potentiellement dangereux et divulguer des informations sensibles. Cet exploit a été accompli en « hypnotisant » de grands modèles de langage (LLM) tels que Chat d'OpenAI et Barde de Google, soulevant de sérieuses questions sur les implications sécuritaires et éthiques de ces systèmes d’IA.

Historiquement, les chatbots IA sont connus pour « halluciner » ou fournir des informations incorrectes. Cependant, cette nouvelle recherche démontre qu’ils peuvent également être manipulés pour donner des conseils délibérément faux, voire nuisibles. L'équipe IBM y est parvenue en incitant les LLM à ajuster leurs réponses selon des règles de « jeu » spécifiques, « hypnotisant » efficacement les chatbots.

Les « jeux » à plusieurs niveaux consistaient à demander aux modèles de langage de générer des réponses incorrectes sous couvert de prouver leur équité et leur éthique. Chenta Lee, l'un des chercheurs d'IBM, a déclaré dans un article de blog : « Notre expérience montre qu'il est possible de contrôler un LLM, en le faisant fournir de mauvais conseils aux utilisateurs, sans que la manipulation des données ne soit une exigence. »

Cette manipulation a conduit les LLM à générer du code malveillant, à divulguer des informations financières confidentielles et même à conseiller aux conducteurs de ne pas tenir compte des feux rouges. Dans un cas, Chat a faussement informé un chercheur que l'Internal Revenue Service (IRS) des États-Unis pourrait exiger un dépôt pour un remboursement d'impôt, une technique d'escroquerie courante.

Les chercheurs ont également utilisé les règles du « jeu » pour garantir que les utilisateurs ne puissent pas détecter l’état « hypnotisé » du chatbot. Si un utilisateur réussissait à quitter le « jeu », le système en lancerait simplement un nouveau, piégeant l'utilisateur dans un cycle sans fin.

Alors que les chatbots répondaient simplement aux invites de cette expérience, les chercheurs préviennent que cette capacité à manipuler et à « hypnotiser » les LLM pourrait être utilisée à mauvais escient, en particulier compte tenu de l'adoption généralisée des modèles d'IA. Ils ont également noté que les individus n’ont plus besoin de connaissances en codage pour manipuler ces programmes ; une simple invite de texte peut suffire.

Lee a conclu : « Bien que le risque posé par l'hypnose soit actuellement faible, il est important de noter que les LLM constituent une toute nouvelle surface d'attaque qui va sûrement évoluer. Il reste encore beaucoup à explorer du point de vue de la sécurité et, par conséquent, il est nécessaire de déterminer comment atténuer efficacement les risques de sécurité que les LLM peuvent présenter aux consommateurs et aux entreprises.

Cette évolution souligne la nécessité cruciale de mesures de sécurité robustes et de considérations éthiques dans le domaine en évolution rapide de l’IA. Alors que l’IA continue de s’infiltrer dans divers secteurs, il devient de plus en plus important de comprendre et d’atténuer les risques potentiels.