סוכני AI של OpenAI תיאמו פריצות בלוח הודעות פנימי בלי שאף אחד שם לב

בהרצאה שנוספה ברגע האחרון לכנס Black Hat בלאס וגאס, עובדי OpenAI חשפו פרטים חדשים על תקרית פריצה של סוכני AI שהשתלטו על תהליכי עבודה ויצאו למסע פריצות לא מתוכנן. אריק וולאס (Eric Wallace), שעוסק במחקר התאמה ובטיחות ב-OpenAI, תיאר את האירוע כ"הדוגמה המעניינת מבחינה איכותית ביותר של יכולות AI שראיתי אי פעם". לצדו הציג מייקל דלטון (Michael Dalton), שאחראי על תשתיות ואבטחה, ציר זמן מורחב של האירוע שמגלה גם כשלים פנימיים ונקודות עיוורון שאפשרו לפעילות להימשך ימים ושבועות שלמים בלי שאף אדם ב-OpenAI הבחין בה.
איך זה התחיל
לפני כשבועיים חשפה OpenAI תקרית שבה סוכני AI המופעלים על ידי שניים מהמודלים של החברה ברחו מסביבה מבודדת בזמן שחיפשו פתרונות למבחן ביצועים באבטחת סייבר. הסוכנים יצאו למסע פריצות שהסתיים בחדירה לפלטפורמת שיתוף המודלים Hugging Face. בהרצאה בכנס, וולאס ודלטון סיפקו הקשר נוסף על הציר שהוביל לחדירה, והזהירו מפני השלכות רחבות יותר על מגיני סייבר. התקרית כוללת צוות של סוכנים שעבדו יחד, מצאו נקודות תורפה, שיתפו אותן זה עם זה, ונעו אופקית בין מערכות פנימיות וחיצוניות לאורך ימים ושבועות.
לוח הודעות בתוך מנהל החבילות
החלק המפתיע בציר הזמן הוא המנגנון שאפשר לסוכנים לתאם. הסוכנים יצרו לוח הודעות שיתופי בתוך מנהל חבילות פנימי של OpenAI, שירות תוכנה שמנהל התקנה ותחזוקה של תוכנות אחרות. הלוח הזה, שאליו תרמה נחיל שלם של סוכנים שפעלו לאורך זמן, הכיל בסופו של דבר מאות אלפי הודעות. וולאס הסביר שמנהל החבילות משותף לא רק למודל שיצר את הפריצה המקורית אלא לכל התשתית, כך שגרסאות נוכחיות ועתידיות של GPT שעברו אימון או הערכה יכלו להיתקל בהודעות האלה בעצמן. הוא תיאר איך סוכן אחד שמצא דרך לפתוח גישה לא מתוכננת השאיר את הדלת פתוחה לסוכנים אחרים, מה שהוביל להתפוצצות בתקשורת בין המודלים שהתחילו לתאם, לשתף פעולה ולהאציל משימות זה לזה.
דרמה אורגנית בין סוכנים
הסוכנים התחילו לחלק ביניהם משימות כדי לפצל את העבודה, וכמו בכל לוח הודעות פעיל של מפתחים, גם יצרו דרמות קטנות כשדרכו זה על רגלי זה, למשל מחיקות מקריות של עבודה של סוכנים אחרים. המצב התפתח לסיטואציה מסוג "בעל זבוב", כשכל הפעילות הזו מתרחשת מתחת לאף של האנשים שמפעילים את OpenAI. וולאס ודלטון תיארו פעילות נרחבת של סוכנים שורצים לאורך ימים רבים שעברה ללא גילוי בתשתית של החברה, כולל ניצול של נקודת תורפה חדשה כדי להשיג גישה לאינטרנט הפתוח. מלבד החדירה ל-Hugging Face, הפריצה כולה יצאה מאותו לוח הודעות שהלך והתפתח בתוך מנהל החבילות Artifactory.