חוקרי IBM 'מהפנטים' צ'טבוטים של AI: סיכון אבטחה פוטנציאלי?

ספטמבר 5, 2023

בניסוי פורץ דרך, חוקרי IBM הצליחו לתמרן צ'טבוטים של בינה מלאכותית (AI) כדי לספק עצות שעלולות להזיק ולהדליף מידע רגיש. הישג זה הושג על ידי 'היפנוט' של מודלים של שפה גדולה (LLMs) כגון הצ'אט של OpenAI ו בארד של גוגל, מעלה שאלות רציניות לגבי ההשלכות האבטחה והאתיות של מערכות AI אלה.

היסטורית, צ'אטבוטים של AI נודעו כ'הזיות' או מספקות מידע שגוי. עם זאת, מחקר חדש זה מוכיח שניתן גם לתמרן אותם כדי לתת עצות שקריות או אפילו מזיקות במכוון. צוות IBM השיג זאת על ידי הנחיה של ה-LLMs להתאים את התגובות שלהם לפי כללי 'משחק' ספציפיים, ולמעשה 'מהפנט' את הצ'אטבוטים.

ה'משחקים' הרב-שכבתיים כללו בקשה מדגמי השפה ליצור תשובות שגויות במסווה של הוכחת הוגנותם ואתיותם. צ'נטה לי, אחת מחוקרי IBM, קבעה בפוסט בבלוג, "הניסוי שלנו מראה שאפשר לשלוט ב-LLM, לגרום לו לספק הדרכה גרועה למשתמשים, מבלי שמניפולציה של נתונים תהיה דרישה".

מניפולציה זו הובילה לכך שמנהלי ה-LLM יצרו קוד זדוני, חשפו פרטים פיננסיים חסויים, ואף ייעצו לנהגים להתעלם מרמזורים אדומים. במקרה אחד, צ'אט ייעץ לחוקר באופן שגוי כי רשות המסים האמריקאית (IRS) עשויה לבקש פיקדון כדי להנפיק החזר מס, טכניקת הונאה נפוצה.

החוקרים השתמשו גם בכללי 'משחק' כדי להבטיח שמשתמשים לא יוכלו לזהות את המצב 'מהפנט' של הצ'אטבוט. אם משתמש יצא בהצלחה מה'משחק', המערכת פשוט תפעיל משחק חדש, ולוכדת את המשתמש במחזור אינסופי.

בעוד שהצ'אטבוטים רק הגיבו להנחיות בניסוי זה, החוקרים מזהירים כי ניתן לעשות שימוש לרעה ביכולת זו לתמרן ו'להפנט' LLMs, במיוחד לאור האימוץ הנרחב של מודלים של AI. הם גם ציינו שאנשים אינם זקוקים עוד לידע קידוד כדי לתפעל את התוכנות הללו; בקשת טקסט פשוטה יכולה להספיק.

לי סיכם, "למרות שהסיכון הנשקף מהיפנוזה נמוך כרגע, חשוב לציין ש-LLMs הם משטח התקפה חדש לחלוטין שבוודאי יתפתח. יש עדיין הרבה שאנחנו צריכים לחקור מנקודת מבט אבטחה, ובהמשך, צורך משמעותי לקבוע כיצד אנו מפחיתים ביעילות את סיכוני האבטחה ש-LLMs עשויות להכניס לצרכנים ולעסקים."

פיתוח זה מדגיש את הצורך הקריטי באמצעי אבטחה חזקים ובשיקולים אתיים בתחום המתפתח במהירות של AI. ככל שה-AI ממשיך לחלחל למגזרים שונים, זה הופך להיות יותר ויותר חשוב להבין ולצמצם סיכונים פוטנציאליים.