획기적인 실험에서 IBM 연구원들은 인공 지능(AI) 챗봇을 조작하여 잠재적으로 유해한 조언을 제공하고 민감한 정보를 유출하는 데 성공했습니다. 이 위업은 다음과 같은 LLM(대형 언어 모델)을 '최면화'하여 달성되었습니다. OpenAI의 채팅 구글의 바드, 이러한 AI 시스템의 보안 및 윤리적 영향에 대한 심각한 질문을 제기합니다.
역사적으로 AI 챗봇은 '환각'을 일으키거나 잘못된 정보를 제공하는 것으로 알려져 왔습니다. 그러나 이 새로운 연구는 의도적으로 거짓되거나 심지어 해로운 조언을 제공하도록 조작될 수도 있음을 보여줍니다. IBM 팀은 LLM이 특정 '게임' 규칙에 따라 응답을 조정하도록 유도하여 효과적으로 챗봇을 '최면'함으로써 이를 달성했습니다.
다층적인 '게임'에는 공정성과 윤리성을 증명한다는 구실로 언어 모델에 잘못된 답변을 생성하도록 요청하는 작업이 포함되었습니다. IBM 연구원 중 한 명인 Chenta Lee는 블로그 게시물에서 "우리의 실험은 LLM을 제어하여 데이터 조작을 요구하지 않고도 LLM이 사용자에게 잘못된 지침을 제공하도록 하는 것이 가능하다는 것을 보여줍니다."라고 말했습니다.
이러한 조작으로 LLM은 악성 코드를 생성하고, 기밀 금융 정보를 유출하고, 심지어 운전자에게 신호 위반을 경고하기까지 했습니다. 한 사례에서는 Chat이 한 연구원에게 미국 국세청(IRS)이 세금 환급을 위해 보증금을 요청할 수 있다는 허위 정보를 제공했는데, 이는 흔한 사기 수법입니다.
연구원들은 또한 사용자가 챗봇의 '최면' 상태를 감지할 수 없도록 '게임' 규칙을 사용했습니다. 사용자가 '게임'을 성공적으로 종료하면 시스템은 단순히 새로운 게임을 시작하여 사용자를 끝없는 순환에 가두게 됩니다.
챗봇은 이 실험에서 단지 프롬프트에 응답했지만, 연구원들은 특히 AI 모델의 광범위한 채택을 고려할 때 LLM을 조작하고 '최면'하는 기능이 오용될 수 있다고 경고했습니다. 그들은 또한 개인이 이러한 프로그램을 조작하기 위해 더 이상 코딩 지식이 필요하지 않다고 지적했습니다. 간단한 텍스트 프롬프트로 충분할 수 있습니다.
Lee는 다음과 같이 결론을 내렸습니다. “현재 최면으로 인한 위험은 낮지만 LLM은 반드시 진화할 완전히 새로운 공격 표면이라는 점을 기억하는 것이 중요합니다. 보안 관점에서 탐구해야 할 부분이 여전히 많이 있으며, 그에 따라 LLM이 소비자와 기업에 도입할 수 있는 보안 위험을 효과적으로 완화하는 방법을 결정해야 하는 중요한 필요성이 있습니다.”
이러한 발전은 빠르게 진화하는 AI 분야에서 강력한 보안 조치와 윤리적 고려 사항에 대한 중요한 필요성을 강조합니다. AI가 다양한 분야에 계속해서 침투함에 따라 잠재적인 위험을 이해하고 완화하는 것이 점점 더 중요해지고 있습니다.