חוקרים חשפו שיטה לחילוץ "שרשרת המחשבה" הנסתרת של מודלי חזית

חוקרים מאוניברסיטת טיבינגן, מכון מקס פלאנק, מכון MATS Research וחברת האבטחה Snyk גילו שכל ספקיות המודלים הגדולות, OpenAI, Anthropic ו-Google, חשופות למתקפה שמאפשרת לחשוף את שלבי ההיגיון הפנימיים שהמודלים מבצעים בדרך לתשובה. השיטה מנצלת את העובדה שהחברות שולחות גרסה מוצפנת של ההיגיון למחשב המשתמש כדי להוריד עומס חישובי, ושגרסאות קטנות יותר של אותו מודל חולקות את אותו מפתח הצפנה אבל עברו פחות אימון יישור ולכן מסרבות פחות לחשוף את מה שמתרחש "מתחת למכסה המנוע".
איך המתקפה עובדת בפועל
הטריק פשוט באופן מטריד: מזינים את עקבות ההיגיון המוצפנות לגרסה הקטנה והזולה יותר של אותו מודל, וזו מפענחת אותן בלי להתנגד. החוקרים מדגימים שהמודל הסיני Kimi K3 של Moonshot AI מייצר עקבות היגיון דומות להפליא לאלה של Claude Opus 4.8 ו-GPT 5.6 Sol בפרומפטים מסוימים. עם זאת, שני מודלים אחרים במשקל פתוח, DeepSeek הסיני ו-Inkling של Thinking Machines האמריקאית, לא הראו דמיון כזה. החוקרים מדגישים במפורש שהממצאים "לא יכולים לקבוע סיבתית זיקוק" (distillation), והעבודה עדיין לא עברה ביקורת עמיתים.
לא רק ריגול תעשייתי, גם דליפת סודות
אלכסנדר פנפילוב (Alexander Panfilov), מדען מחשב בטיבינגן שהוביל את העבודה, מציין שהפגיעות מאפשרת שני סוגי נזק: דליפת מידע אישי כמו סיסמאות ומפתחות API (שכבר תוקנה), ומתקפות זיקוק היגיון בהיקף גדול. זיקוק היא טכניקה מוכרת ונפוצה להעברת יכולות ממודל קיים לחדש, אבל בחודשים האחרונים הפכה לנפיצה פוליטית: OpenAI טענה בפברואר בפני מחוקקים אמריקאים ש-DeepSeek העתיקה את אחד המודלים שלה לבניית R1, ו-Anthropic טענה ביוני ש-Alibaba זיקקה באופן שיטתי את מודליה לבניית Qwen.
מה זה אומר להמשך
החוקרים מבהירים שאין אינדיקציה שחברות סיניות השתמשו דווקא בטכניקה הזו לזיקוק מודלים אמריקאיים, אבל השיטה שלהם מראה שאפשר לחלץ ממודלים סגורים יותר מידע היגיון ממה שהיה ידוע קודם. Moonshot AI ו-Z.ai לא הגיבו לפניות עד מועד הפרסום. השאלה שנותרת פתוחה היא לא אם הזיקוק קרה, אלא עד כמה קל יהיה לחזור על הטריק הזה בגרסאות הבאות של המודלים, וכמה מהר הספקיות יחליפו מפתחות או יוסיפו שכבות הגנה על עקבות ההיגיון המוצפנות.