הבדיקה שתפתיע גם אתכם: על איזה מודל AI אפשר לסמוך באמת?
בדיקה של Tom’s Guide הציגה לחלק מהצ׳אטבוטים שאלות על אירועים ומוצרים חדשים. ChatGPT ענה נכון על כל השאלות שנבדקו
- קובי ברקת
- ו' תשרי התשפ"ז
אנחנו רגילים לשאול כלי בינה מלאכותית מה קרה היום, איזה מוצר הושק השבוע או מהו הדגם החדש ביותר של חברה מסוימת, אבל חיבור לאינטרנט לא מבטיח שהתשובה שנקבל תהיה עדכנית.
Tom’s Guide ערך בדיקה קטנה שבה הציג ל- ChatGPT, ל Gemini ול Claude חמש שאלות על מידע חדש יחסית. התוצאה הראתה פערים משמעותיים בין הכלים.
בשאלה על מכשירי האייפון החדשים, ChatGPT ו- Gemini זיהו נכון את iPhone 18 Pro, את iPhone 18 Pro Max ואת iPhone Duo המתקפל. Claude, לעומתם, השיב שסדרת iPhone 17 היא החדשה ביותר, אף שאפל הכריזה על הדגמים החדשים ב 9 בספטמבר.
גם כשנשאלו מהו דגם הדגל החדש ביותר של Claude, התוצאות היו מעניינות. ChatGPT זיהה נכון את Claude Fable 5.1, בעוד Gemini ו Claude עצמו מסרו תשובות לא מעודכנות. Anthropic אכן הכריזה על Fable 5.1 בתחילת ספטמבר.
בשאלה נוספת על שילוב שירותי בינה מלאכותית חיצוניים ב Google Home, ChatGPT ו Gemini הכירו את העדכון ואילו Claude לא.
אבל כאן מגיע הסייג החשוב. הבדיקה השתמשה ב Claude 4.6, ולא ב Claude Fable 5.1, שהוא הדגם המתקדם והחדש יותר של Anthropic.
חשוב לסייג ולהדגיש כי גם חמישה מבחנים אינם מספיקים כדי לקבוע מי הצ׳אטבוט המעודכן ביותר באופן מוחלט. הם כן ממחישים בעיה אמיתית: מודל יכול להיות חדש מאוד ועדיין להסתמך בחלק מהתשובות על ידע ישן, ואם הוא לא מחליט לבצע חיפוש ברשת בזמן הנכון הוא עלול לענות בביטחון על סמך מידע שכבר אינו נכון.
בבדיקה המסוימת הזאת ChatGPT נתן את התוצאה המדויקת ביותר, אבל המסקנה החשובה יותר היא אחרת: כששואלים על חדשות, מחירים, מוצרים חדשים, פוליטיקה או כל מידע שמשתנה במהירות, כדאי לוודא שהמערכת אכן חיפשה מידע עדכני ולבדוק את המקורות שעליהם היא מסתמכת.


הוספת תגובה
לכתבה זו טרם התפרסמו תגובות