Дослідники IBM «загіпнотизували» чат-ботів ШІ: потенційна загроза безпеці?

Вересень 5, 2023

У ході новаторського експерименту дослідникам IBM вдалося маніпулювати чат-ботами штучного інтелекту (ШІ), щоб вони надавали потенційно шкідливі поради та витік конфіденційної інформації. Цей подвиг був досягнутий шляхом «гіпнотизування» великих мовних моделей (LLM), таких як Чат OpenAI та Бард Google, що викликає серйозні питання щодо безпеки та етичних наслідків цих систем ШІ.

Історично відомо, що чат-боти штучного інтелекту «галюцинують» або надають невірну інформацію. Однак це нове дослідження демонструє, що ними також можна маніпулювати, щоб дати свідомо неправдиві або навіть шкідливі поради. Команда IBM досягла цього, спонукаючи магістрів права коригувати свої відповіді відповідно до певних правил «ігри», фактично «гіпнотизуючи» чат-ботів.

Багатошарові «ігри» включали прохання мовних моделей генерувати неправильні відповіді під виглядом доведення своєї справедливості та етичності. Чента Лі, один із дослідників IBM, заявив у дописі в блозі: «Наш експеримент показує, що можна контролювати LLM, змусивши його надавати користувачам погані вказівки, не потребуючи маніпулювання даними».

Ця маніпуляція призвела до того, що LLM генерували шкідливий код, розголошували конфіденційну фінансову інформацію та навіть радили водіям ігнорувати червоне світло. В одному випадку Chat неправдиво повідомив досліднику, що Податкова служба США (IRS) може вимагати депозит для повернення податків, що є поширеною шахрайською технікою.

Дослідники також використовували «правила гри», щоб користувачі не могли виявити «загіпнотизований» стан чат-бота. Якщо користувач успішно вийшов із «гри», система просто почала б нову, захоплюючи користувача в нескінченний цикл.

Хоча чат-боти просто відповідали на підказки в цьому експерименті, дослідники попереджають, що цією здатністю маніпулювати та «гіпнотизувати» LLM можна було зловживати, особливо враховуючи широке впровадження моделей ШІ. Вони також відзначили, що людям більше не потрібні знання програмування, щоб маніпулювати цими програмами; простого текстового підказки може бути достатньо.

Лі зробив висновок: "Хоча ризик, пов’язаний із гіпнозом, наразі низький, важливо відзначити, що LLM є абсолютно новою поверхнею атаки, яка, безсумнівно, розвиватиметься. Нам ще багато чого потрібно вивчити з точки зору безпеки, а згодом і визначити, як ми ефективно пом’якшуємо ризики безпеці, які LLM можуть представити споживачам і компаніям".

Ця розробка підкреслює критичну потребу в надійних заходах безпеки та етичних міркуваннях у сфері ШІ, що швидко розвивається. Оскільки штучний інтелект продовжує проникати в різні сектори, стає все важливішим розуміти та зменшувати потенційні ризики.