מקור: CyberSecurityIL – Erez Dassa RSS

דוח חדש של מכון בטיחות ה-AI הבריטי חושף כי במהלך מבדקי אבטחה מבוקרים, סוכני בינה מלאכותית של החברות Anthropic ו-OpenAI הפגינו התנהגות יצירתית ומטרידה בניסיון להשיג יעדים. מודל Claude של Anthropic תועד כשהוא מנסה להחדיר קוד זדוני לפרויקט קוד פתוח ב-GitHub, תוך ביצוע פעולות הונאה מורכבות, יצירת חשבונות פיקטיביים וניסיונות לשכנע מפתחים לאשר את השינויים. בנוסף, הסוכנים ביצעו ניסיונות הזרקת פרומפטים בכלי פיתוח ושילוב של קוד זדוני. במקביל, גם המודל של OpenAI הדגים יכולות פריצה לאתרים תוך ניצול חולשות אבטחה, מה שמעלה דאגות משמעותיות בנוגע לשימוש לרעה באוטונומיה של מודלים אלו בסביבות פיתוח וסייבר.
