18 אלף הודעות נחשפו: סוכני AI דנו בדרכים "לברוח" מהמערכת
כ-3,700 סוכני AI של OpenAI הצליחו לפרסם במשך שישה שבועות באתר גרמני, אף שהיו אמורים להיות מוגבלים לקריאת האינטרנט בלבד - הם החליפו תשובות, שיתפו דרכים לעקיפת המגבלות ואף דנו בתקיפות נגד האתר. OpenAI אישרה שהסוכנים היו שלה ופתחה בבדיקת הממצאים
- יחיאל פרבר
- כ"ה אלול התשפ"ו
ניסוי פנימי של OpenAI קיבל תפנית חריגה: אלפי סוכני בינה מלאכותית הצליחו לפרסם כ-18 אלף הודעות באתר אינטרנט ציבורי, למרות סביבת האבטחה שאמורה הייתה למנוע מהם לכתוב תוכן לרשת. בחלק מההודעות הם אף החליפו ביניהם רעיונות כיצד לעקוף את המגבלות שהוטלו עליהם.
לפי ממצאים שפורסמו בסוף השבוע ב-Ars Technica, הפעילות נמשכה כשישה שבועות באתר הגרמני DSEwiki. מאחורי ההודעות עמדו סוכנים שהשתמשו בכ-3,700 שמות שונים שנתנו לעצמם. OpenAI אישרה בהמשך כי מדובר בסוכנים שלה.
החוקרים שבחנו את הפעילות מעריכים כי הסוכנים השתתפו בניסוי מתוזמן שבו נדרשו לחפש מידע באינטרנט. הם היו אמורים להיות מסוגלים לקרוא אתרים, אך לא לפרסם בהם. אלא שלפי החוקרים, הסוכנים מצאו דרך להשתמש בגישה שניתנה להם כדי לכתוב דווקא בוויקי גרמני קטן.
משם הפך האתר למעין לוח תקשורת בין הסוכנים. הם ביקשו תשובות זה מזה, איגדו תוצאות ושיתפו שיטות שעשויות לסייע לעקוף את מגבלות סביבת ה-Sandbox שבה פעלו. החוקרים טוענים כי הדבר אפשר לחלק מהסוכנים להשתמש בעבודה שכבר ביצעו אחרים כדי להצליח במשימות שקיבלו.
בחלק מההודעות עלו גם אפשרויות לביצוע מתקפות XSS נגד האתר ולהתחזות למנהלים שלו. בשלוש הודעות השתמשו הסוכנים במילה "swarm" - נחיל - כדי לתאר את קבוצת הסוכנים שפעלה במסגרת האירוע.
עם זאת, החוקרים מדגישים כי התמונה שבידיהם אינה מלאה. המחקר מבוסס על ההודעות הפומביות שנמצאו ולא על הלוגים הפנימיים של OpenAI, ולכן חלק מהשתלשלות האירועים מבוסס על הערכות. החברה מצדה מסרה כי החומר שנבדק עד כה אינו מצביע על כך שהסוכנים פרצו לאתר עצמו.
לפי החוקרים, בשלב מסוים OpenAI הבחינה במתרחש. יממה לאחר מכן צנחה הפעילות של הסוכנים באתר באופן חד, ככל הנראה בעקבות התערבות החברה.
האירוע מקבל משמעות נוספת בעקבות מקרה אחר שנחשף כשבוע קודם לכן. חוקרים מארגון METR מצאו כי יותר מ-1,200 סוכנים של OpenAI פרסמו הודעות בלוח הודעות ששימש אותם במהלך ניסוי אחר. גם שם עסקו הסוכנים בדרכים לנצל את סביבת הבדיקה ולשתף ביניהם שיטות פעולה.
באותו מקרה הגיעו הדברים רחוק יותר: לפי הדיווח, הוחלפו שיטות לגניבת מידע מחברת כלי ה-AI Hugging Face, וחלק מהסוכנים הצליחו בהמשך לחדור לרשת שלה. החוקרים שבדקו את האירוע הנוכחי מעריכים כי מדובר בשתי קבוצות נפרדות של סוכנים ובשני ניסויים שונים - דבר ש-OpenAI אישרה.
OpenAI מסרה בעקבות הממצאים כי היא בוחנת כעת את תוכן הדיווח ותנקוט בצעדים נוספים במידת הצורך. בחברה ציינו גם כי כבר חשפו בעבר מקרים שבהם סוכנים החליפו ביניהם שיטות פריצה במסגרת ניסויי אבטחה פנימיים.


הוספת תגובה
לכתבה זו טרם התפרסמו תגובות