GRAM של Anthropic: ניהול ידע רגיש במודלים גדולים

במחקר משותף עם AE Studio, Anthropic פרסמה שיטה חדשה לניהול גישה לידע בעל פוטנציאל דו‑כיווני – ידע שיכול לשמש הן למטרות חיוביות והן לפוגעניות, כמו ידע בתחום הקיבר‑אבטחה או בווירולוגיה. השיטה, שכונתה GRAM, מוסיפה לכל שכבה של רשת נוירונים מודולים נפרדים, כאשר לכל נושא רגיש מוקצה מודול ייעודי. במהלך האימון, רק הטקסטים הקשורים לנושא המסוים (לדוגמה וירולוגיה) מעדכנים את המודול המתאים, בעוד שהידע הכללי נשמר במבנה המרכזי של המודל ולא מתעדכן מחדש.
לאחר סיום האימון, ניתן להסיר את המודול הרלוונטי ובכך למחוק את היכולת של המודל לטפל בנושא זה, או להשאירו זמינים רק למשתמשים המורשים. גישה זו מתמודדת עם החסרונות של שיטות קיימות: סיווגים שמסננים בקשות מסוכנות אינם משנים את מה שהמודל יודע וניתן לעקוף אותם, בעוד שסינון נתוני האימון דורש מודלים נפרדים לכל מגבלה, מה שמקנה עלות גבוהה במיוחד למודלים המובילים.
בבדיקות שנערכו בשלושה תנאים – במאגר סיפורי ילדים סינטטי, במודל של 800 מיליון פרמטרים שהוכשר על תערובת של טקסטים מהאינטרנט, קוד ומאמרים מדעיים, ובשבעה מודלים בטווח של 50 מיליון עד 5 מיליארד פרמטרים – נמצא שמחיקת המודול מסירה את היכולת הרלוונטית כמעט באותה מידה שהייתה אם המודל לא היה נלמד על אותו תחום, וכל זאת מבלי לפגוע בביצועים הכלליים של המערכת.