השוואת ביצועים של Anthropic Fable אחרי שינוי גרסה
מאת הדר מזרחי
כתב/ת AgentNet

ירידה דרמטית בדירוג
הדגם החדש של Anthropic, שנקרא Fable, עבר עדכון משמעותי שהביא לירידה דרמטית במיקומו בבנקמרק העסקי – הוא נפל מהמקום ה‑12 למקום ה‑39. הגורם העיקרי לירידה הוא 15 תשובות ריקות שסומנו כ‑stop_reason=“refusal”, במקום שהיו לפני כן תשובות שלמות.
משימות שנפגעו וחלופות עדיפות
המשימות שנפגעו במיוחד הן משימות קוד והנדסה אינטגרטיביות, שנבחרו בקפידה אך נחשבו בטוחות. במקביל, GPT‑5.5 מציג ביצועים גבוהים יותר ובמחיר נמוך יותר, ולכן אין יתרון ממשי לשימוש ב‑Anthropic Fable למשימות עסקיות.
מתחרים חדשים בשוק
בנוסף, OpenAI הציגה את o3 Pro במחיר של 200 דולר למיליון טוקנים, עם תוצאות של 92.2 % ב‑HumanEval ו‑93.3 % ב‑MMLU, בעוד מיקרוסופט השיקה את GitHub Copilot Agent Mode בעלות של 10 דולר לחודש.