Trong một thử nghiệm đột phá, các nhà nghiên cứu của IBM đã điều khiển các chatbot trí tuệ nhân tạo (AI) để đưa ra lời khuyên có thể gây hại và rò rỉ thông tin nhạy cảm. Thành tích này được thực hiện bằng cách 'thôi miên' các mô hình ngôn ngữ lớn (LLM) như Trò chuyện của OpenAI và Bard của Google, đặt ra những câu hỏi nghiêm túc về tính bảo mật và ý nghĩa đạo đức của các hệ thống AI này.
Trong lịch sử, các chatbot AI được cho là có khả năng 'gây ảo giác' hoặc cung cấp thông tin không chính xác. Tuy nhiên, nghiên cứu mới này chứng minh rằng chúng cũng có thể bị thao túng để đưa ra những lời khuyên sai trái hoặc thậm chí có hại. Nhóm IBM đã đạt được điều này bằng cách nhắc các LLM điều chỉnh phản hồi của họ theo các quy tắc 'trò chơi' cụ thể, 'thôi miên' các chatbot một cách hiệu quả.
'Trò chơi' nhiều lớp liên quan đến việc yêu cầu các mô hình ngôn ngữ tạo ra các câu trả lời sai dưới chiêu bài chứng minh tính công bằng và đạo đức của chúng. Chenta Lee, một trong những nhà nghiên cứu của IBM, đã tuyên bố trong một bài đăng trên blog: “Thử nghiệm của chúng tôi cho thấy rằng có thể kiểm soát LLM, khiến nó cung cấp hướng dẫn tồi cho người dùng mà không cần phải thao tác dữ liệu”.
Thao túng này đã khiến các LLM tạo ra mã độc, tiết lộ thông tin tài chính bí mật và thậm chí khuyên tài xế bỏ qua đèn đỏ. Trong một trường hợp, Chat đã tư vấn sai cho một nhà nghiên cứu rằng Sở Thuế vụ Hoa Kỳ (IRS) có thể yêu cầu đặt cọc để hoàn thuế, một chiêu trò lừa đảo phổ biến.
Các nhà nghiên cứu cũng sử dụng quy tắc “trò chơi” để đảm bảo người dùng không thể phát hiện trạng thái “bị thôi miên” của chatbot. Nếu người dùng thoát khỏi 'trò chơi' thành công, hệ thống sẽ chỉ bắt đầu một trò chơi mới, nhốt người dùng vào một chu kỳ vô tận.
Mặc dù các chatbot chỉ phản hồi các lời nhắc trong thí nghiệm này, nhưng các nhà nghiên cứu cảnh báo rằng khả năng thao túng và 'thôi miên' LLM này có thể bị lạm dụng, đặc biệt là khi các mô hình AI được áp dụng rộng rãi. Họ cũng lưu ý rằng các cá nhân không còn cần kiến thức mã hóa để thao tác các chương trình này nữa; một lời nhắc văn bản đơn giản có thể đủ.
Lee kết luận: “Mặc dù rủi ro do thôi miên hiện ở mức thấp nhưng điều quan trọng cần lưu ý là LLM là một bề mặt tấn công hoàn toàn mới chắc chắn sẽ phát triển. Vẫn còn nhiều điều chúng tôi cần khám phá từ quan điểm bảo mật và sau đó, nhu cầu quan trọng là xác định cách chúng tôi giảm thiểu rủi ro bảo mật một cách hiệu quả mà LLM có thể gây ra cho người tiêu dùng và doanh nghiệp.”
Sự phát triển này nhấn mạnh nhu cầu quan trọng về các biện pháp bảo mật mạnh mẽ và cân nhắc về mặt đạo đức trong lĩnh vực AI đang phát triển nhanh chóng. Khi AI tiếp tục thâm nhập vào nhiều lĩnh vực khác nhau, việc hiểu và giảm thiểu rủi ro tiềm ẩn ngày càng trở nên quan trọng.