חוקרים מציגים את ABBEL: מסגרת שמחליפה סיכומים רקורסיביים במצבי אמונה מתעדכנים כדי לפתור את כשל

הדחיסה במשימות ארוכות טווח מודלי שפה גדולים עדיין נכשלים כשמנסים לדחוס היסטוריית אינטראקציה ארוכה לסיכום קצר בלי לאבד יכולת ביצוע; ABBEL מציעה חלופה שמפרידה את משימת הסיכום ומפקחת על תוכנו באמצעות מנגנון דירוג בהשראת אוטואנקודר. המאמר, שפורסם כפרה-פרינט בסוף יולי, מדגים כי מודלים שמבצעים דחיסת קונטקסט (Context Compaction) במהלך אימון חיזוק לא מצליחים לסגור את הפער מול מודלים ששומרים את ההקשר המלא, אפילו בבנצ'מרק פשוט יחסית כמו Combination Lock, משחק בסגנון Wordle עם עד 16 ניחושים. שרתי מודלים כמו Cursor עדיין ממליצים למשתמשים להימנע מדחיסה באמצע משימת קוד, והחוקרים תולים את הסיבה בקושי לייצר סימולטורים אנושיים איכותיים לאימון (Lin et al., 2025; Tomlin et al., 2025).
הבעיה עם דחיסת קונטקסט
הצורך בדחיסה נובע ממגבלה בסיסית: חלונות קונטקסט לא יכולים לגדול לנצח כשמשימות כמו פיתוח תוכנה דורשות מאות או אלפי צעדי אינטראקציה. הגישה ההאוריסטית עד כה הייתה סיכום רקורסיבי, Cursor Composer 2.5 משתמש בדחיסה במהלך אימון (Cassano et al., 2026), וגם Grandcode של DeepReinforce, המערכת הראשונה שניצחה באופן עקבי מתחרים אנושיים בתחרויות קוד מקוונות תוך שימוש ב-Qwen 3.5-397B, נאלצה להטמיע סיכום קונטקסט. אלא שבפועל, מודלי סיכום משתפרים באימון חיזוק אך לא סוגרים את הפער ממודלי הקונטקסט המלא, כפי שנראה בגרף הניסיונות הממוצעים לניחוש המטרה ב-Combination Lock.
מצבי אמונה במקום סיכומים גולמיים
ABBEL (Acting Through Belief Bottlenecks) משנה את הפרדיגמה: במקום לבקש מהמודל לסכם את ההיסטוריה כטקסט חופשי, היא מנסחת את הסיכום כמצב אמונה (belief state) שהמודל מעדכן מחזורית על סמך מידע חדש, בהשראת הערכה בייזיאנית רקורסיבית. האמונה מחליפה את היסטוריית האינטראקציה המלאה כקונטקסט העבודה של הסוכן, והעדכון מתבצע על ידי קידוד האמונה הקודמת, הפעולה והתצפית החדשה לאמונה הבאה.
מנגנון דירוג אמונה בהשראת אוטואנקודר
החידוש המרכזי הוא Belief Grading, משימת חיזוק עזר שמתגמלת את המודל על פי יכולת לשחזר מידע נבחר מההיסטוריה מתוך מצב האמונה הדחוס. החוקרים מדגימים את היוריסטיקה לתחום הקוד: אמונה טובה היא קצרה יותר, אבל גם קרובה יותר ליכולת לשחזר את הדיפ של גיט; איזון בין השניים מניב אמונה יעילה. בתחומים שבהם קשה להגדיר היוריסטיקות ספציפיות, הם מציעים פונקציית דירוג כללית בהשראת אוטואנקודר, שמתייחסת ל… (הטקסט נקטע כאן).
מה חסר ומה הלאה
המאמר מציג כיוון מבטיח לבעיה כאובה בסוכני קוד ארוכי טווח, אך נותר בגדר פרה-פרינט ללא שיפוט עמיתים; לא פורסמו מדדי ביצועים מלאים מול בסיסי השוואה מקובלים כמו SWE-bench או משימות קוד רב-שלביות אחרות, ולא ברור איך המנגנון מתמודד עם הזיות במצב האמונה עצמו. אם הדירוג האוטואנקודרי אכן עובד בפועל, ייתכן שנראה אימוץ בכלים כמו Cursor או Grandcode בדורות הבאים, אבל עד לפרסום תוצאות מלאות וקוד פתוח, זה עדיין מחקר על הנייר.