Claude Sonnet 5: שיפור משמעותי, אך לא תחליף מיידי ל‑Opus

Anthropic הציגה את Claude Sonnet 5, מודל סוכנותי מהשורה של Claude, שנפתחת גם למשתמשים בתוכנית החינמית. מדד Intelligence Index של Artificial Analysis העניק לו 53 נקודות, מה שממקם אותו בחמישי בטבלה, כש‑GPT‑5.5 ו‑Claude Opus 4.8 עומדים לפניו ברווח של שניים‑שלושה נקודות בלבד, בעוד שהפער מול Fable עומד על שבע נקודות. לעומת Sonnet 4.6, המודל החדש מדווח על עלייה של שישה נקודות ברמת המחשבה המקסימלית.
ביצועי קידוד ועלויות
בתחרות הקידוד, Cursor מציין כי במבחן CursorBench, שמדמה משימות מרובות קבצים, Sonnet 5 הגיע ל‑57 % מדויק לעומת 49 % של Sonnet 4.6. העלות של השימוש במודל, עם זאת, עולה משמעותית: עלות משימה אחת ב‑API של Sonnet 5 הייתה כפולה כמעט לזו של Sonnet 4.6 ו‑15 % יותר יקרה מזו של Opus 4.8, זאת עקב ייצור של 40 % יותר טוקנים ופעמים שלוש יותר שלבים סוכנותיים כמו חיפוש מידע, ניתוח מסמכים והפקת פתרונות.
טוקניזציה וביקורת קוד
הטוקניזציה החדשה של Sonnet 5 מוסיפה משקל: Simon Willison מצא שטקסט אנגלי צורך 1.4‑פפל יותר טוקנים, טקסט ספרדית 1.33‑פפל וקוד Python 1.28‑פפל, בעוד שלסינית פשוטה כמעט ולא נצפתה עלייה. מבחינת ביקורת קוד, CodeRabbit מדווח על שיפור בדיוק (precision) מ‑29 % ל‑38‑40 % לעומת Sonnet 4.6, אך במציאת באגים התוצאה נחתה ל‑51 % מול 63 % של הגרסה הקודמת, והעלות כמעט הכפילה.
סיכום ומסקנות
סיכום: Sonnet 5 משופר בקידוד ובמשימות סוכנותיות, אך Opus 4.8 נשאר המוביל במצבים של חשיבה עמוקה. מספר 5 דקות.