מקור: Palo Alto Unit 42

תמונת תקציר לחדשת סייבר: מחקר חדש של Unit 42 חושף רגישות במנגנוני הבטיחות של מודלי שפה גדולים

חוקרי יחידת Unit 42 של פאלו אלטו נטוורקס פרסמו מחקר העוסק בבחינת יציבותם של מנגנוני הבטיחות במודלי שפה גדולים (LLM). המחקר מציג שיטה חדשה המכונה Perturbation Probing, המאפשרת לאבחן את עמידות המודלים בפני ניסיונות לעקוף את הוראות הבטיחות שלהם. על פי הממצאים, מנגנוני הסירוב של המודלים מבוססים לעיתים על שכבה עצבית דקה ופגיעה, מה שמעלה את הצורך באסטרטגיות הגנה רב-שכבתיות חיצוניות. המחקר מדגיש כי הסתמכות בלעדית על ההגנות המובנות במודלים אינה מספקת, ומציע כלים חדשים לניתוח וחיזוק האבטחה של מערכות בינה מלאכותית מול סיכונים פוטנציאליים.

קראו במקור

תגובות בפייסבוק:

תגובות

תפריט נגישות