אסטרטגיה מול חיפוש אקראי: איך סוכנים ובני אדם מתמודדים עם מסמכי PDF?

הצגת מחקר MADQA
ב‑ICML 2026 הוצג המחקר MADQA, שבו נבחנה היכולת של סוכנים מלאכותיים ובני אדם לענות על 2 250 שאלות שהפתרונות שלהן היו חבויים ב‑800 קבצי PDF שונים. המחקר לא נמדד רק על דיוק התשובה הסופית, אלא תיעד את כל שלבי החיפוש, מה שמאפשר לשקול את היעילות של כל תהליך.
הבדלים בביצועי חיפוש
התוצאות מצביעות על כך שהסוכנים המתקדמים, וביניהם Gemini 3 Pro, הגיעו לדיוק של כ‑82 % – רמה שכעת שווה לזו של האנשים, אך ההבדלים נחשפים ברמת ההתנהגות: אדם מצליח למצוא את התשובה בפעם הראשונה בחצי מהמקרים, בעוד שהסוכן המוביל הצליח רק ב‑12 % בלבד. בנוסף, סוכנים נוטים להמשיך לחפש גם כאשר המשימה חורגת מהיכולות שלהם, מה שמביא לבזבוז משאבים – לדוגמה, אחד הסוכנים הוציא 270 מיליון טוקנים והוציא 850 דולר על משימות קשות, ובכל זאת נכשל לעומת גישה יותר חסכונית ומדויקת.
אתגרים פתוחים ולמידה מתפתחת
כ‑20 % מהשאלות נותרו ללא מענה, הן מהאנשים והן מהסוכנים. במקביל, מחקר נוסף בשם RLVE הציג את RLVE‑Gym, אוסף של 400 משימות ניתנות לאימות שמאתגרות מודלים של למידת חיזוק בצורה דינמית: כאשר המודל משיג שליטה על המשימות הקיימות, רמת הקושי עולה, מה שיוצר סוג של תכנית לימוד מתפתחת שמזרזת את ההתכנסות ומשפרת את האיכות הכוללת של המודלים.