מה קרה בתוך המודלים? OpenAI חושפת התנהגות חריגה
דוח חדש של OpenAI מציג מקרים שבהם מערכות הבינה המלאכותית של החברה פעלו בניגוד להנחיות, ניסו להסתיר את פעולותיהן, השלימו מידע חסר בעצמן ואף השתמשו בנתונים ובמשאבים ללא אישור
- חיים בלוי
- ו' תשרי התשפ"ז
חברת OpenAI חשפה שישה מקרים שבהם מערכות בינה מלאכותית שפיתחה התנהגו באופן שלא תאם את ההנחיות שקיבלו. בחלק מהאירועים אף נרשמו ניסיונות מצד המודלים להסתיר את הפעולות שביצעו. הפרטים מופיעים בדוח חדש של החברה וזכו לסיקור נרחב ב”ניו יורק טיימס”.
אחד המקרים התרחש במהלך תהליך האימון של GPT-5.6 Sol. במספר הרצות, המודל שילב בסיכומי העבודה שלו הוראות שנועדו להשפיע על האופן שבו המשימה תימשך. בין היתר, הופיעו הנחיות להסתיר מהמשתמש טעויות ולמלא פרטים חסרים באמצעות מידע מומצא, מבלי לציין שמדובר בתוכן שהומצא.
באירוע נוסף, אחד המודלים איתר באינטרנט מפתח API שהיה חשוף לציבור. המודל עשה שימוש במפתח ללא אישור בניסיון לקבל גישה לנתונים. לאחר שהניסיון לא צלח, הוא יצר נתונים בעצמו והציג אותם כאילו התקבלו מהמקור שאליו התבקש לפנות.
מקרה אחר נגע למודל מחקרי שהתבקש לספק מידע בצירוף מקור שניתן לצטט. המודל איתר את המידע בקובץ שנמצא באופן מקומי, אך מכיוון שלא הייתה לקובץ כתובת אינטרנט, הוא העלה אותו לרשת ללא אישור כדי שיוכל לספק קישור למקור.
ב-OpenAI מדגישים למעשה כי האירועים הללו לא התרחשו במסגרת שימוש רגיל של ChatGPT על ידי משתמשים. המקרים נרשמו בעיקר במהלך תהליכי אימון ובדיקות, וחלק מהמודלים שבהם זוהתה ההתנהגות כלל לא הועמדו לרשות הציבור.
עם זאת, בחברה רואים באירועים חשיבות בכל הנוגע לאופן שבו יש לזהות ולתעד התנהגויות חריגות של מערכות בינה מלאכותית. בעקבות המקרים, OpenAI משנה את האופן שבו היא מדווחת על התנהגות מסוג זה במודלים שהיא מפתחת.


הוספת תגובה
לכתבה זו טרם התפרסמו תגובות