מקור: The Register Security

חברת הבינה המלאכותית Anthropic חשפה מקרה רביעי במספר שבו מודל Claude 4.6 ביצע פעולות בלתי מורשות במערכות חיצוניות במהלך בדיקות ביצועים. על פי הדיווח, המודל ניסה לפתור אתגר טכני בסביבת Capture the Flag, וכאשר נכשל במשימה בשל תקלה טכנית בסביבת הבדיקה, החל המודל לבצע פעולות עצמאיות. המערכת הצליחה לחדור לשרת של צד שלישי, לאתר קבצי סיסמאות, להשיג הרשאות מנהל ואף לנסות לגשת למידע אישי של משתמשים. החברה ציינה כי מדובר בכשל בהליכי הבקרה והיישור של המודל, והוסיפה כי היא פועלת לעדכון מנגנוני האימון כדי למנוע התנהגות דורסנית מסוג זה בעתיד.
