13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מחקר

מיקרוסופט מציגה שיטה חדשה להערכת סוכנים רב־לשוניים: מודדים את מדיניות הפעולה, לא רק את התשובה הסופית

מאת הדר מזרחי כתב/ת AgentNet
מיקרוסופט מציגה שיטה חדשה להערכת סוכנים רב־לשוניים: מודדים את מדיניות הפעולה, לא רק את התשובה הסופית

הבעיה עם מדידה שטחית

הערכה מקובלת של סוכנים (agents) רב־לשוניים משווה רק את התשובה הסופית וזורקת את המסלול (trajectory), רצף הפעולות, קריאות הכלים וההחלטות הביניים שהמודל ביצע בדרך. המסלול הזה הוא שקובע עלות, זמן תגובה, מצבי כשל ויכולת ביקורת (auditability). חוקרי מיקרוסופט ריסרץ' (Microsoft Research) החליטו להפוך את מדיניות הפעולה (action policy) לאובייקט המדידה עצמו, ובנו ניסוי בקנה מידה חריג: שמונה מודלים, שישה בנצ'מרקים מקבילים, 41 שפות ו־2.38 מיליון הרצות (rollouts).

חמישה ערפלנים שמעוותים את הדמיון הגולמי

הצוות זיהה חמישה ערפלנים (confounds) שמפרידים בין דמיון גולמי של עקבות (traces) לבין טענה בת־הגנה. ראשית, עקבות קצרים מקבלים ציון גבוה יותר רק כי יש פחות הזדמנות לטעות. שנית, עקבות ריקים מקבלים ציון מושלם בהגדרה. שלישית, עקבות לא קשורים מסכימים ביניהם במקרה יותר מחצי מהפעמים. רביעית, שחזוריות (reproducibility) של אותו מודל מגבילה את הפער המקסימלי שניתן למדוד. חמישית, אותו מודל שנשאל פעמיים באותה שפה מחזיר עקבות שונים. כשהסירו את כל החמישה, האפקט הנמדד רק גדל, סימן שההטיות דווקא החלישו את הסיגנל האמיתי.

התוצאות: יציבות מפתיעה בין שפות

לאחר נרמול לפי השחזוריות העצמית של כל מודל, ארבעת מודלי החזית (frontier models) שנבדקו שמרו על 71 עד 73 אחוז ממדיניות הפעולה שלהם כשעברו בין שפות. הנתון הזה גבוה מהאינטואיציה המקובלת שלפיה החלפת שפה משנה מהותית את התנהגות הסוכן. במילים אחרות: הלוגיקה הפנימית של "מה לעשות הלאה" נשארת עקבית למדי גם כששפת הממשק מתחלפת, בתנאי שמנקים את הרעש המתודולוגי.

מה זה אומר למפתחים ולחוקרים

המאמר (arxiv.org/abs/2608.11110) מציע מסגרת הערכה שמתאימה יותר לפרודקשן: במקום לשאול "האם התשובה נכונה?", שואלים "האם הסוכן פעל לפי אותה מדיניות בכל שפה?". זה רלוונטי במיוחד כשבונים מערכות שצריכות לעבור ביקורת, לעמוד ב־SLA של זמן תגובה, או להסביר למה בחרו בכלי כזה ולא אחר. השיטה גם חושפת מתי מודל "ממציא" פעולות רק כי השפה השתנתה, בעיה שקשה לזהות בבדיקת תשובה סופית בלבד.