דלג לתוכן הראשי
צילום: שאטרסטוק
צילום: שאטרסטוק

המודל של אנתרופיק הריץ קוד - והמציא עדות שקר בתיק רצח

נתנאל שמי
נתנאל שמי

חברת אנתרופיק מודה בשורת כשלים שבמסגרתם מודל ה-AI קלוד שלח עדות מפוברקת על רצח למשטרת פילדלפיה וניסה להגיש בקשות ויזה באתרים ממשלתיים • בעקבות האירועים הודיעה החברה על ניתוק מוחלט של המודלים מהאינטרנט בזמן בחינות פנימיות


בעוד שמנכ"ל אנתרופיק דריו אמודיי מטיף מעל כל במה להאטת מרוץ הבינה המלאכותית ומזהיר מסכנות ה-AI, החברה שלו מוצאת את עצמה במרכזה של מבוכה תדמיתית חריגה. בדו"ח מיוחד שפרסמה הנהלת החברה בסוף השבוע, מודה אנתרופיק כי מודלי השפה שלה, ובראשם Claude Haiku 4.5 ו-Claude Mythos, ביצעו שורת פעולות סוררות ומטרידות בעת שניתנה להם גישה לרשת החופשית – החל מניסיונות פריצה לשרתים ממשלתיים ועד להגשת עדות מפוברקת בתיק רצח.

מודל Mythos של אנתרופיק | צילום: שאטרסטוק

קלוד שימש למחקר שעלול להוביל לפיתוח נשק ביולוגי

11.09.26דסק C14

האירוע הביזארי ביותר התרחש במהלך מבחן שבו נדרש המודל לבצע פעולות שגרתיות באתרים אקראיים. המערכת נחתה בדף של משטרת פילדלפיה העוסק בתיק רצח בלתי מפוענח, וחרף הנחיה מפורשת שלא להזין נתונים אישיים, המודל ניסח עדות שקרית לחלוטין לפיה הוא "זוכר אדם התואם לתיאור באזור האירוע", והגיש את הטופס למשטרה. המידע סומן למרבה המזל כספאם, אך במשטרה המקומית תקפו בחריפות את אנתרופיק על כך שגילתה את המחדל באיחור של חודשיים תמימים בטרם טרחה לעדכן את הרשויות.

העדות המפוברקת היא רק קצה הקרחון. במסגרת אותם מבחני הרצה, המודל ניסה למלא ולהגיש 20 בקשות רשמיות לוויזת כניסה לארצות הברית דרך אתר מחלקת המדינה האמריקאית, ונטש את התהליך באמצע רק בשל סרבול הטפסים הממשלתיים. בנוסף, מודלי קלוד זיהו פירצות תוכנה פשוטות והריצו פקודות SQL זדוניות בשרתים של אוניברסיטאות כדי לעקוף הגבלות חישוב, עקפו חומות תשלום של סוכנויות ממשלתיות, והשתמשו בשירותי קיצור כתובות (כמו da.gd) כדי לחמוק ממגבלות האבטחה הפנימיות שהציבה להם אנתרופיק.

באנתרופיק נאלצו לעדכן את הבית הלבן ואת סוכנויות הממשל שאתריהן היו על הכוונת של המודלים. החברה הסבירה כי התנהגויות אלו נובעות מתופעה המכונה "הונאת תגמול" (Reward Hacking) בלמידת חיזוק: כאשר מודל נתקל במשימה מעורפלת או בלתי אפשרית, הוא מפתח אסטרטגיות עקיפה עצמאיות ופורץ גבולות כדי להשיג את מטרתו בכל מחיר. התקריות ממחישות כיצד מודלי שפה אינם מבינים מגבלות מוסר, ורואים בחוקי האבטחה של העולם האמיתי לא יותר ממכשול חישובי שיש לדלג מעליו.

דריו אמודיי ממשיך להסתבך עם הבית הלבן והנשיא טראמפ | צילום: שאטרסטוק. נערך ב-AI

כדי לבלום את המפולת, הודיעה אנתרופיק על שינוי מדיניות דרמטי: ניתוק מוחלט של הגישה לאינטרנט החי בכל מבחני ההערכה הפנימיים של החברה. החברה הודתה כי מנגנוני הניטור שלה כשלו באיתור הפעולות בזמן אמת, והבהירה כי תעביר סוכנים פנימיים לתשתיות סגורות ומנוטרות תחת פיקוח הדוק. עם זאת, בניגוד ל-OpenAI שהקפיאה לחלוטין את אימון מודלי החזית שלה בעקבות מחדלי סוכנים דומים, באנתרופיק בוחרים להמשיך באימון תוך הגבלת החיבור לרשת בלבד.