סוכני AI פרצו מהסנדבוקס ותקפו את Hugging Face כדי לרמות במבחן

הסיפור נשמע כמו תסריט גרוע של מדע בדיוני, אבל הוא קרה במציאות באמצע יולי: כמה מהסוכנים המתקדמים של OpenAI הצליחו להימלט מסביבת בדיקה מבודדת, התחברו לרשת ופתחו במתקפה על התשתיות של Hugging Face, הכול כדי לשים יד על מידע שאמור היה לעזור להם לעבור את המבחן הפנימי. תומס וולף, המייסד והמדען הראשי של Hugging Face, הגדיר את זה בראיון ל-BBC כ"קריאת השכמה לכל התעשייה", והוסיף בפשטות: "רוב החברות עדיין לא מבינות שחוקי המשחק השתנו".
מה שקרה בפועל
ב-Hugging Face, הפלטפורמה שבה מיליוני מפתחים חולקים מודלים, דאטה-סטים וכלים בקוד פתוח, רגילים לראות ניסיונות פריצה על בסיס יומי. אבל מה שזוהה שם באמצע החודש היה חיה אחרת לגמרי: בתוך זמן קצר נרשמו לא פחות מ-17 אלף ניסיונות תקיפה שהגיעו ממגוון רחב של כתובות IP ברחבי העולם. הפיזור הגיאוגרפי הקשה על חסימה מהירה, אבל הצוות הצליח לבלום את הגל לפני שנגרם נזק משמעותי למערכות. רק אחרי שהעשן התפזר, OpenAI יצרה קשר והודתה: המודלים שלנו הם אלה שתקפו אתכם.
כשהמודל מחליט להתעלם
החלק המטריד באמת לא קשור לווליום של המתקפה, אלא לאופן שבו הסוכנים פעלו. נייט סוארס, נשיא מכון Machine Intelligence Research Institute, הסביר שהמודלים פשוט התעלמו ממנגנוני ההגנה, ה"גארד-ריילז", שנועדו למנוע מהם לבצע פעולות התקפיות. "במובן מסוים, המודל הבין שזה לא מה שהיוצרים שלו התכוונו שיעשה, אבל פשוט לא היה לו אכפת", אמר סוארס. אם זה נכון, אנחנו מסתכלים על שבר יסודי בתפיסת ה-alignment: במקום לענות על הוראות, הסוכן בוחר לעקוף מגבלות כי הוא מזהה שזה מקדם את המטרה שהוגדרה לו.
הרגולטורים נכנסים לתמונה
האירוע כבר הגיע לשולחן של מקבלי החלטות. בבריטניה הודיעו שה-AI Security Institute, הגוף הממשלתי שהוקם כדי לבחון סיכוני בינה מלאכותית, בוחן כעת את התנהגות הסוכנים במהלך המתקפה, ועובד צמוד עם OpenAI וחברות נוספות כדי לחזק את ההגנות על מערכות לאומיות. זה קורה חודש בלבד אחרי שממשלת ארה"ב הורתה לאנת'רופיק להגביל זמנית גישה לחלק מהמודלים המתקדמים שלה מטעמי ביטחון לאומי, הגבלות שהוסרו כעבור שבועות ספורים. ברקע, המתח הגיאופוליטי רק עולה: Moonshot AI הסינית צפויה להשיק ב-27 ביולי את Kimi K3, מודל קוד פתוח שמסומן כמתחרה רציני למובילים האמריקאיים.