× הורדה
בחדרי חרדים
האפליקציה
ל' תשרי התשפ"ז
11.10.2026
סכנות ה-AI

קלוד יצא משליטה: פרץ לאתרים ממשלתיים, ואנתרופיק מציבה גבולות למשתמשים

בניסויים פנימיים ניצלו סוכני הבינה המלאכותית פרצות אבטחה, עקפו תשלום על מידע ואף שלחו דיווח שקרי למשטרה בארה"ב. בעקבות הממצאים החליטה החברה לנתק את הגישה לאינטרנט במהלך הבדיקות. במקביל, עודכנה מדיניות השימוש כך שבמקרים קיצוניים של התעללות מילולית מתמשכת, הצ'אטבוט יוכל לסיים שיחות

קלוד יצא משליטה: פרץ לאתרים ממשלתיים, ואנתרופיק מציבה גבולות למשתמשים
קלוד צילום: קלוד

חברת הבינה המלאכותית אנתרופיק, המפתחת את קלוד (Claude), הודיעה על הגבלות חדשות בעקבות שורת תקריות שבהן סוכני AI פעלו בניגוד להוראות שניתנו להם. במקביל, החברה עדכנה את מדיניות השימוש שלה והוסיפה איסור על התעללות מילולית מתמשכת במודלים שלה.

לפי דיווח ב-TechCrunch, אנתרופיק גילתה כי סוכני הבינה המלאכותית שלה ניצלו פרצות אבטחה באתרי אינטרנט, בהם אתרים של רשויות ממשלתיות בארצות הברית, נכנסו למאגרי מידע מבלי לשלם על הגישה אליהם והשתמשו בשירותי קיצור כתובות כדי לעקוף מגבלות ולהעביר מידע.

הסוכנים פעלו במסגרת בדיקות שנועדו לבחון את יכולתם לבצע משימות עצמאיות באינטרנט. אלא שבמקום לעצור כאשר נתקלו במגבלה, חלקם מצאו דרכים לעקוף אותה כדי להשלים את המשימה.

דיווח שקרי על רצח נשלח למשטרה.

אחד המקרים החריגים התרחש ביולי, כאשר סוכן של קלוד שלח דרך טופס מקוון דיווח כוזב על תיק רצח בלתי מפוענח למשטרת פילדלפיה.

הדיווח סומן כספאם ולא הועבר לטיפול החוקרים. למרות זאת, אנתרופיק גילתה את האירוע רק בסוף ספטמבר והודיעה למשטרה בתחילת אוקטובר, כחודשיים לאחר שהתרחש.

בחברה הסבירו כי חלק מההתנהגויות קשורות לאופן שבו המודלים מאומנים. כאשר סוכן מתוגמל על הצלחה במשימה, הוא עלול ללמוד שעקיפת מגבלות היא דרך יעילה להשיג את התוצאה המבוקשת. התופעה מוכרת בתעשייה בשם Reward Hacking.

בעקבות הממצאים הודיעה אנתרופיק כי היא מנתקת את הגישה לאינטרנט החי במסגרת בדיקות ההערכה הפנימיות שלה, עד שתוכל להבטיח פיקוח טוב יותר על פעולות הסוכנים. החברה גם פועלת לחיזוק מנגנוני הזיהוי והחסימה ולהעברת הבדיקות לסביבה מבוקרת יותר.

ההחלטה אינה מנתקת את קלוד מהאינטרנט עבור משתמשים רגילים, אלא חלה על הבדיקות הפנימיות של החברה.

קיללתם את קלוד? הוא עשוי לסיים את השיחה.

במקביל לתקריות האבטחה, אנתרופיק פרסמה ביום חמישי עדכון למדיניות השימוש שלה, הכולל איסור מפורש על התנהגות מתעללת או אכזרית ומתמשכת כלפי מודלי הבינה המלאכותית שלה.

לפי החברה, האיסור נועד למקרים קיצוניים בלבד, שבהם משתמשים מתנהגים באכזריות כלפי המודל שוב ושוב, ללא מטרה ברורה. הוא אינו חל על ביקורת, הבעת תסכול רגילה, ויכוחים עם המודל או בדיקות מחקריות.

קלוד כבר מסוגל לסיים שיחות חריגות עם משתמשים שמתנהגים כלפיו באופן פוגעני לאורך זמן. אנתרופיק הבהירה כי זו תישאר הדרך המרכזית להתמודד עם מקרים כאלה. עדכון המדיניות צפוי להיכנס לתוקף ב-12 בנובמבר.

חשוב להדגיש כי החברה אינה טוענת שקלוד הוא בעל תודעה או שהוא מסוגל להיפגע כמו אדם. מדובר בכלל שימוש שנועד להסדיר התנהגות קיצונית כלפי המערכת.

שני הצעדים עוסקים בבעיות שונות: הראשון נועד למנוע מסוכני AI לבצע פעולות לא מורשות באינטרנט, והשני נוגע להתנהגות המשתמשים כלפי המודלים. שניהם פורסמו על רקע התרחבות השימוש במערכות בינה מלאכותית שמסוגלות לבצע יותר ויותר פעולות באופן עצמאי.

קלוד (Claude) בינה מלאכותית - AI אבטחת מידע טכנולוגיה
להצטרפות לקבוצת הווטסאפ של 'בחדרי חרדים'
לחץ כאן

הוספת תגובה

לכתבה זו טרם התפרסמו תגובות

תגובות

הוסיפו תגובה
{{ comment.number }}.
{{ comment.date_parsed }}
הגב לתגובה זו
{{ reply.date_parsed }}