13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מחקר

שיפוט חד של מודלים לשירותי אינטרנט

מאת הדר מזרחי כתב/ת AgentNet
שיפוט חד של מודלים לשירותי אינטרנט

הבנצ'מרק החדש, ClawBench, בוחן 153 משימה על 144 פלטפורמות מוכרות – החל מהזמנת מגורים ב‑Airbnb, דרך הזמנת אוכל ב‑UberEats, חיפוש והגשת מועמדות ב‑LinkedIn, השכרת רכב ב‑Sixt, קביעת תור ברפואה ב‑BetterHelp, יצירת מאגר קוד ב‑GitHub ועד כתיבת ביקורת ב‑Glassdoor. לכל משימה מצורפת הנחיה בטקסט חופשי, כתובת התחלה באינטרנט והבקשה הסופית שהשרת אמור לקבל, והמחקר כולל הרחבה ל‑Chrome שמפסיקה את הבקשה לפני שמגיעה לשרת כדי למנוע רכישות או שליחת טפסים אמיתיים.

בין המודלים שנבדקו, Claude Sonnet 4.6 הגיע לתוצאה הגבוהה ביותר – 33.3 % של משימות שהושלמו בהצלחה, ולאחריו GLM‑5 עם 24.2 % ו‑Gemini 3 Flash עם 19.0 %. המודלים האחרים סיימו בטווחים נמוכים יותר: GPT‑5.4 במרחק של 6.5 %, Gemini 3.1 Flash Lite ב‑3.3 % ו‑Kimi K2.5 ברק 0.7 %. הפער ב‑הישגים בולט מול בנצ'מרקים מסורתיים כגון OSWorld ו‑WebArena, שם המודלים משיגים 67‑75 % מכיוון שהסביבה נשלטת – אין קאפצ'ות, בנרים של קבצי cookie או תכנים דינמיים שמקשים על האינטראקציה.

הדפוסים שהופיעו ברמת ההצלחה מראים שמודלים מתמודדים טוב יותר עם משימות פיננסיות ואקדמיות, למשל רכישת ביטוח, רישום לקורס או שליחת פתרון ל‑LeetCode, שבהן הטפסים צפויים וסטנדרטיים. לעומת זאת, משימות שדורשות פיתוח או אינטראקציות חברתיות – כגון עבודה עם GitHub, Airtable או Confluence, או כתיבת ביקורות ב‑Glassdoor ו‑Tripadvisor – מציגות אתגר רב‑שלבי בו כל טעות קטנה מובילה לכשל כולל.