画期的な実験で、IBMの研究者たちは人工知能(AI)チャットボットを操作して、潜在的に有害なアドバイスを提供したり、機密情報を漏洩させたりすることに成功した。 この偉業は、次のような大規模言語モデル (LLM) を「催眠」することによって達成されました。 OpenAIのチャット (NAIST) と グーグルの吟遊詩人、これらの AI システムのセキュリティと倫理的影響について深刻な疑問が生じています。
歴史的に、AI チャットボットは「幻覚」を見せたり、誤った情報を提供したりすることが知られています。 しかし、この新しい研究は、意図的に誤った、あるいは有害なアドバイスを与えるように操作される可能性があることを示しています。 IBM チームは、LLM に特定の「ゲーム」ルールに従って応答を調整するよう促し、チャットボットに効果的に「催眠をかける」ことでこれを達成しました。
多層的な「ゲーム」には、公平性と倫理性を証明するという名目で、言語モデルに不正解を生成するよう求めることが含まれていました。 IBMの研究者のXNUMX人であるChenta Lee氏はブログ投稿で、「私たちの実験は、データ操作を必要とせずにLLMを制御し、ユーザーに悪いガイダンスを提供することが可能であることを示した」と述べた。
この操作により、LLMは悪意のあるコードを生成し、機密の財務情報を漏洩し、ドライバーに赤信号を無視するようアドバイスすることさえありました。ある事例では、チャットは研究者に対し、米国国税庁(IRS)が税金の還付を行うために預託金を要求する可能性があると虚偽のアドバイスをしました。これはよくある詐欺の手口です。
研究者らはまた、「ゲーム」ルールを使用して、ユーザーがチャットボットの「催眠」状態を検出できないようにしました。 ユーザーが「ゲーム」から正常に終了すると、システムは単純に新しいゲームを開始し、ユーザーを無限のサイクルに閉じ込めます。
この実験ではチャットボットはプロンプトに応答しているだけだが、特に AI モデルが広く普及していることを考えると、LLM を操作して「催眠術をかける」この能力が悪用される可能性があると研究者らは警告している。 彼らはまた、個人がこれらのプログラムを操作するためにコーディングの知識を必要としないことにも言及しました。 単純なテキスト プロンプトで十分です。
Lee 氏は次のように結論付けました。「催眠術によってもたらされるリスクは現時点では低いですが、LLM は確実に進化するまったく新しい攻撃対象領域であることに注意することが重要です。 セキュリティの観点からはまだ検討すべきことが多く、LLM が消費者や企業にもたらす可能性のあるセキュリティ リスクを効果的に軽減する方法を決定することが重要です。」
この発展は、急速に進化する AI 分野における堅牢なセキュリティ対策と倫理的配慮の重要な必要性を浮き彫りにしています。 AI がさまざまな分野に浸透し続けるにつれて、潜在的なリスクを理解し、軽減することがますます重要になっています。