DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים

המיקום בקוד ארנה
המודל DeepSeek-V4-Pro (Max) מתברג במקום השמיני הכללי בלוח התוצאות של Code Arena: WebDev עם 1,607 נקודות. רק GPT-5.6 Sol (xHigh) מקדים אותו בצמרת עם 1,622 נקודות, ובקרב המודלים שמשקליהם פתוחים הוא שני בלבד, אחרי Kimi K3 (Max) שעומד על 1,674 נקודות.
תוצאות טקסט ארנה
בזירת הטקסט המצב צפוף יותר: DeepSeek-V4-Pro (Max) מדורג חמישי בין המודלים הפתוחים עם 1,465 נקודות במדד AutoEval. הוא יושב ממש על אותו טווח כמו GLM-5.1 עם 1,467 נקודות, GPT-5.6 Terra (xHigh) עם 1,464 וגם Grok 4.6 (High) עם 1,464, הפרשים זניחים שנופלים בתוך מרווח השגיאה של ההערכה האוטומטית.
מה המספרים באמת אומרים
שני הלוחות מבוססים על הערכה אוטומטית (AutoEval) ולא על שיפוט אנושי, מה שאומר שהפערים הקטנים, נקודות בודדות לכאן או לכאן, לא בהכרח משקפים הבדל מורגש בשימוש יומיומי. Code Arena: WebDev בודק משימות פיתוח ווב ספציפיות, ואילו Text Arena מכסה מגוון רחב יותר של מטלות שפה; הצטיינות באחד לא מבטיחה דבר לגבי השני.
תמונת המתחרים
הנוכחות של שלושה מודלים סיניים, DeepSeek, Kimi ו-GLM, בצמרת הלוחות הפתוחים מצביעה על כך שהמעבדות הסיניות סגרו פער משמעותי מול הגרסאות הסגורות של OpenAI ו-xAI. עדיין, GPT-5.6 Sol (xHigh) שומר על הובלה בקוד, וכל המודלים המובילים בטקסט צמודים זה לזה בטווח של שלוש נקודות.
מה חסר בתמונה
לא פורסמו מדדי ביצועים נוספים מעבר לשני הלוחות הללו, אין תאריך השקה רשמי לגרסת Max, ולא ברור באיזה רישיון ישוחררו המשקלים, פרט קריטי כשמדברים על "מודל פתוח" מול "משקלים פתוחים". עד שיגיעו מבחנים עצמאיים וקוד זמין, המספרים הם אינדיקציה בלבד, לא הוכחה.