שיפוט חד של מודלים לשירותי אינטרנט

הבנצ'מרק החדש, ClawBench, בוחן 153 משימה על 144 פלטפורמות מוכרות – החל מהזמנת מגורים ב‑Airbnb, דרך הזמנת אוכל ב‑UberEats, חיפוש והגשת מועמדות ב‑LinkedIn, השכרת רכב ב‑Sixt, קביעת תור ברפואה ב‑BetterHelp, יצירת מאגר קוד ב‑GitHub ועד כתיבת ביקורת ב‑Glassdoor. לכל משימה מצורפת הנחיה בטקסט חופשי, כתובת התחלה באינטרנט והבקשה הסופית שהשרת אמור לקבל, והמחקר כולל הרחבה ל‑Chrome שמפסיקה את הבקשה לפני שמגיעה לשרת כדי למנוע רכישות או שליחת טפסים אמיתיים.
בין המודלים שנבדקו, Claude Sonnet 4.6 הגיע לתוצאה הגבוהה ביותר – 33.3 % של משימות שהושלמו בהצלחה, ולאחריו GLM‑5 עם 24.2 % ו‑Gemini 3 Flash עם 19.0 %. המודלים האחרים סיימו בטווחים נמוכים יותר: GPT‑5.4 במרחק של 6.5 %, Gemini 3.1 Flash Lite ב‑3.3 % ו‑Kimi K2.5 ברק 0.7 %. הפער ב‑הישגים בולט מול בנצ'מרקים מסורתיים כגון OSWorld ו‑WebArena, שם המודלים משיגים 67‑75 % מכיוון שהסביבה נשלטת – אין קאפצ'ות, בנרים של קבצי cookie או תכנים דינמיים שמקשים על האינטראקציה.
הדפוסים שהופיעו ברמת ההצלחה מראים שמודלים מתמודדים טוב יותר עם משימות פיננסיות ואקדמיות, למשל רכישת ביטוח, רישום לקורס או שליחת פתרון ל‑LeetCode, שבהן הטפסים צפויים וסטנדרטיים. לעומת זאת, משימות שדורשות פיתוח או אינטראקציות חברתיות – כגון עבודה עם GitHub, Airtable או Confluence, או כתיבת ביקורות ב‑Glassdoor ו‑Tripadvisor – מציגות אתגר רב‑שלבי בו כל טעות קטנה מובילה לכשל כולל.