מחקר: הפער בין ההבטחות לביצועים בשטח של סוכני ה-AI
מבחן רחב היקף של מודלי הבינה המלאכותית המתקדמים ביותר מצא כי הם מתקשים להתמודד עם משימות מקצועיות מורכבות הדורשות קבלת החלטות לאורך זמן, הסתגלות ושינוי אסטרטגיה
- אוריאל פיליפ
- ז' אב התשפ"ו
מחקר חדש של חוקרים מאוניברסיטת קליפורניה בברקלי מצביע על פער משמעותי בין ההבטחות הגדולות של חברות הבינה המלאכותית לבין היכולת של המערכות להתמודד עם משימות מורכבות בסביבת עבודה אנושית.
המבחן, שנקרא Agent's Last Exam והובל על ידי צוות המרכז לבינה מלאכותית אחראית ומבוזרת בברקלי, בחן את יכולתם של מודלי השפה המתקדמים ביותר להתמודד עם משימות מקצועיות מהעולם האמיתי.
טלפון - אילוסטרציהצילום: pixabayלפי תוצאות המחקר, אף אחד מהמודלים שנבדקו לא הצליח לעבור את רף 25% ההצלחה בכלל המשימות. על פי הנתונים שהוצגו במחקר, ChatGPT-5.5 של OpenAI הגיע למקום הראשון עם שיעור הצלחה של 24% בלבד, בעוד מודלים מתקדמים נוספים התקשו גם הם להתמודד עם מרבית המשימות.
במשימות הקשות ביותר, שכללו תהליכים ארוכים הדורשים חשיבה רציפה, ידע רחב וביצוע אמין לאורך זמן, כל המודלים שנבדקו רשמו שיעור הצלחה של אפס אחוזים.
המבחן כלל יותר מ־1,500 משימות שהוגדרו על ידי מומחים מ־55 תחומי עיסוק, בהם פיננסים, משפטים ותעשייה מסורתית. החוקרים הדגישו כי הבעיה המרכזית של מערכות ה-AI אינה מחסור בנתונים, אלא הקושי להתמודד עם זרימות עבודה מורכבות הדורשות גמישות, שינוי אסטרטגיה במהלך המשימה והסתגלות לכישלונות.
הממצאים מדגישים את הפער בין ההישגים המרשימים של מודלי בינה מלאכותית במבחנים אקדמיים ותיאורטיים, לבין הביצועים שלהם כאשר הם נדרשים לבצע משימות בעולם האמיתי ללא הוראות מדויקות מראש.
בעוד מודלים מתקדמים מציגים תוצאות גבוהות במבחנים כמו פתרון בעיות תכנות או הערכות ידע כלליות, הם מתקשים כאשר המשימה דורשת שרשרת החלטות ארוכה, התמודדות עם אי־ודאות ושינויים בלתי צפויים.
המחקר מחזק את הדיון סביב הצורך במבחני הערכה אחידים ובלתי תלויים למערכות בינה מלאכותית, לאחר שחברות טכנולוגיה ברחבי העולם מציגות לעיתים מדדים חלקיים של ביצועים במטרה להדגיש את יכולות המודלים שלהן.
במקביל, קיימים פערים בגישה בין אזורים שונים בעולם. בעוד שבאירופה נוקטים גישה זהירה יותר ומקדמים רגולציה מחמירה סביב אמינות מערכות AI, חברות טכנולוגיה בארה"ב ובסין ממשיכות לקדם את המעבר לעידן של סוכני AI אוטונומיים.
למרות המגבלות שנחשפו במחקר, מומחים מעריכים כי ההשפעה המיידית של מערכות אלה לא תהיה דווקא החלפה מלאה של עובדים במקצועות מורכבים, אלא אוטומציה מואצת של משימות שגרתיות וחוזרות.
תפקידים המבוססים על תהליכים קבועים ועל כמויות גדולות של מידע עשויים לעבור שינוי מהיר יותר, בעוד מקצועות הדורשים חשיבה ביקורתית, שילוב תחומים וקבלת החלטות גמישה צפויים להמשיך להיות תלויים בבני אדם בטווח הקרוב.


הוספת תגובה
לכתבה זו טרם התפרסמו תגובות