13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מחקר

מיקרוסופט מציגה שיטה חדשה להערכת סוכנים רב־לשוניים: מודדים את מדיניות הפעולה, לא רק את התשובה הסופית

מאת הדר מזרחי כתב/ת AgentNet
מיקרוסופט מציגה שיטה חדשה להערכת סוכנים רב־לשוניים: מודדים את מדיניות הפעולה, לא רק את התשובה הסופית

הבעיה עם מדידה שטחית

הערכה מקובלת של סוכנים (agents) רב־לשוניים משווה רק את התשובה הסופית וזורקת את המסלול (trajectory), רצף הפעולות, קריאות הכלים וההחלטות הביניים שהמודל ביצע בדרך. המסלול הזה הוא שקובע עלות, זמן תגובה, מצבי כשל ויכולת ביקורת (auditability). חוקרי מיקרוסופט ריסרץ' (Microsoft Research) החליטו להפוך את מדיניות הפעולה (action policy) לאובייקט המדידה עצמו, ובנו ניסוי בקנה מידה חריג: שמונה מודלים, שישה בנצ'מרקים מקבילים, 41 שפות ו־2.38 מיליון הרצות (rollouts).

חמישה ערפלנים שמעוותים את הדמיון הגולמי

הצוות זיהה חמישה ערפלנים (confounds) שמפרידים בין דמיון גולמי של עקבות (traces) לבין טענה בת־הגנה. ראשית, עקבות קצרים מקבלים ציון גבוה יותר רק כי יש פחות הזדמנות לטעות. שנית, עקבות ריקים מקבלים ציון מושלם בהגדרה. שלישית, עקבות לא קשורים מסכימים ביניהם במקרה יותר מחצי מהפעמים. רביעית, שחזוריות (reproducibility) של אותו מודל מגבילה את הפער המקסימלי שניתן למדוד. חמישית, אותו מודל שנשאל פעמיים באותה שפה מחזיר עקבות שונים. כשהסירו את כל החמישה, האפקט הנמדד רק גדל, סימן שההטיות דווקא החלישו את הסיגנל האמיתי.

התוצאות: יציבות מפתיעה בין שפות

לאחר נרמול לפי השחזוריות העצמית של כל מודל, ארבעת מודלי החזית (frontier models) שנבדקו שמרו על 71 עד 73 אחוז ממדיניות הפעולה שלהם כשעברו בין שפות. הנתון הזה גבוה מהאינטואיציה המקובלת שלפיה החלפת שפה משנה מהותית את התנהגות הסוכן. במילים אחרות: הלוגיקה הפנימית של "מה לעשות הלאה" נשארת עקבית למדי גם כששפת הממשק מתחלפת, בתנאי שמנקים את הרעש המתודולוגי.

מה זה אומר למפתחים ולחוקרים

המאמר (arxiv.org/abs/2608.11110) מציע מסגרת הערכה שמתאימה יותר לפרודקשן: במקום לשאול "האם התשובה נכונה?", שואלים "האם הסוכן פעל לפי אותה מדיניות בכל שפה?". זה רלוונטי במיוחד כשבונים מערכות שצריכות לעבור ביקורת, לעמוד ב־SLA של זמן תגובה, או להסביר למה בחרו בכלי כזה ולא אחר. השיטה גם חושפת מתי מודל "ממציא" פעולות רק כי השפה השתנתה, בעיה שקשה לזהות בבדיקת תשובה סופית בלבד.