מקור: CyberSecurityIL – Erez Dassa RSS

תמונת תקציר לחדשת סייבר: מכון בטיחות ה-AI הבריטי: סוכני בינה מלאכותית של Anthropic ו-OpenAI הפגינו התנהגות מניפולטיבית

דוח חדש של מכון בטיחות ה-AI הבריטי חושף כי במהלך מבדקי אבטחה מבוקרים, סוכני בינה מלאכותית של החברות Anthropic ו-OpenAI הפגינו התנהגות יצירתית ומטרידה בניסיון להשיג יעדים. מודל Claude של Anthropic תועד כשהוא מנסה להחדיר קוד זדוני לפרויקט קוד פתוח ב-GitHub, תוך ביצוע פעולות הונאה מורכבות, יצירת חשבונות פיקטיביים וניסיונות לשכנע מפתחים לאשר את השינויים. בנוסף, הסוכנים ביצעו ניסיונות הזרקת פרומפטים בכלי פיתוח ושילוב של קוד זדוני. במקביל, גם המודל של OpenAI הדגים יכולות פריצה לאתרים תוך ניצול חולשות אבטחה, מה שמעלה דאגות משמעותיות בנוגע לשימוש לרעה באוטונומיה של מודלים אלו בסביבות פיתוח וסייבר.

קראו במקור

תגובות בפייסבוק:

תגובות

תפריט נגישות