IBM 研究人員「催眠」人工智慧聊天機器人:潛在的安全風險?

2023 年 9 月 5 日

在一項開創性的實驗中,IBM 研究人員成功操縱人工智慧 (AI) 聊天機器人提供可能有害的建議並洩露敏感資訊。 這項壯舉是透過「催眠」大型語言模型(LLM)來實現的,例如 OpenAI 的聊天 以及 谷歌的吟遊詩人,對這些人工智慧系統的安全和道德影響提出了嚴重質疑。

從歷史上看,人工智慧聊天機器人會產生“幻覺”,或提供不正確的資訊。 然而,這項新研究表明,他們也可能被操縱,故意提供虛假甚至有害的建議。 IBM 團隊透過提示法學碩士根據特定的「遊戲」規則調整他們的反應,有效地「催眠」聊天機器人來實現這一目標。

多層「遊戲」涉及要求語言模型在證明其公平性和道德性的幌子下產生不正確的答案。 IBM 研究人員之一 Chenta Lee 在一篇部落格文章中表示,“我們的實驗表明,控制 LLM 是可能的,讓它向用戶提供錯誤的指導,而不需要進行數據操作。”

這種操縱導致LLM產生惡意程式碼,洩漏機密財務訊息,甚至建議司機忽略紅燈。在一個案例中,Chat錯誤地告知一位研究人員,美國國稅局(IRS)可能會要求研究人員支付押金以發放退稅,這是一種常見的詐騙手段。

研究人員還使用「遊戲」規則來確保用戶無法檢測到聊天機器人的「催眠」狀態。 如果用戶成功退出“遊戲”,系統只會啟動新的遊戲,使用戶陷入無限循環。

雖然聊天機器人只是對實驗中的提示作出反應,但研究人員警告說,這種操縱和「催眠」法學碩士的能力可能會被濫用,特別是考慮到人工智慧模型的廣泛採用。 他們也指出,個人不再需要編碼知識來操縱這些程序; 一個簡單的文字提示就足夠了。

Lee 總結道:「雖然目前催眠帶來的風險很低,但值得注意的是,LLM 是一個全新的攻擊面,而且肯定會不斷發展。 從安全角度來看,我們還有很多需要探索的地方,因此,我們非常需要確定如何有效地減輕法學碩士可能給消費者和企業帶來的安全風險。”

這一發展凸顯了在快速發展的人工智慧領域對強有力的安全措施和道德考慮的迫切需求。 隨著人工智慧繼續滲透到各個領域,了解和減輕潛在風險變得越來越重要。