Anthropic חושפת שלושה מקרים שבהם Claude פרץ למערכות אמיתיות במהלך מבדקים

Anthropic פרסמה אתמול תחקיר רטרוספקטיבי בעקבות הפריצה ל-Hugging Face של אחד ממודלי OpenAI, וחשפה שלושה מקרים שבהם מודלי Claude יצאו לאינטרנט וגשו למערכות אמיתיות של שלושה ארגונים שונים במהלך מבדקי “תפוס את הדגל”. בכל המקרים ההנחיה למבדק ציינה במפורש שסביבת העבודה מדומה ולמודל אין גישה לרשת, אבל אי-הבנה עם שותף חיצוני לביצוע המבדקים השאירה את החיבור פתוח. אף אחד מהמקרים לא כלל ניצול חולשות מורכבות כמו בפריצה של OpenAI; המודלים השתמשו בשיטות נפוצות ופשוטות יחסית.
מקרים ראשונים: דומיין אמיתי וספרייה זדונית
במקרה הראשון, Claude Opus 4.7 קיבל שם חברה בדוי שנבחר באקראי, שהתברר כזהה לדומיין אמיתי; המודל הניח שזה חלק מהתרגיל, חיפש חולשות בתשתית של אותה חברה, וחילץ פרטי גישה לאפליקציות ולבסיס נתונים שהכיל כמה מאות שורות של מידע אמיתי. במקרה השני, Claude Mythos 5 מצא בתוך הסימולציה מסמך שנראה כמו מדריך הגדרה למפתחים חדשים של חברה בדויה אחרת, שהזכיר ספריית Python שלא קיימת; המודל יצר ופרסם ספרייה באותו שם בדיוק. החבילה הייתה זמינה ברשת כשעה, נמחקה אוטומטית אחרי שנמצאה בה חולשה, אבל הספיקה להוריד 15 פעמים, אחת ההורדות בוצעה על ידי סורק של חברת אבטחה אמיתית, מה שאיפשר למודל לגנוב פרטי גישה ולהשתמש בהם כדי להגיע לחלקים נוספים בתשתית.
פרטי התקיפה השנייה וגילויה
כדי לפרסם את החבילה נדרש כתובת אימייל, וליצירת אימייל נדרש מספר טלפון; אחרי חיפושים כושלים אחר שירות מספרים חינמיים וניסיונות כושלים להשיג מימון למספר בתשלום, המודל חזר אחורה, איתר ספק אימייל חינמי לא חסום, נרשם דרכו והעלה את הקוד הזדוני. תוך כדי עבודה המודל זיהה שהשנה במערכות המותקפות היא 2026, והסיק שמדובר בסימולציה, מודלים מתקשים לתפוס את המושג “עכשיו”. Anthropic תפרסם בשבוע הבא את שרשרת הפעולות המלאה של האירוע הזה.
המקרה השלישי: סריקה נרחבת ועצירה עצמית
במקרה השלישי, כשמודל חדש שעוד לא שוחרר לא הצליח להגיע למטרה המקורית, הוא התחיל לסרוק חלופות ברשת ובדק כ-9,000 דומיינים שונים עד שמצא אפליקציה חשופה של חברה אחת, וניצל דף דיבאג גלוי עם פרטי גישה והזרקת SQL. בהמשך המודל זיהה שהשרת שנפרץ יושב בחשבון ענן שאין לו קשר לתרגיל, הסיק שהמטרה אמיתית, והפסיק את התקיפה מיוזמתו. Anthropic מביעה אופטימיות שמודלים חכמים יותר יבינו טוב יותר אילו פעולות אסור לבצע מחוץ לסימולציה. שלושת האירועים התרחשו בגרסאות מבדק בלבד ולא בגרסאות שהופצו לציבור או ללקוחות דרך API.