13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מודלים

Grok 4.6 מגיע עם תוצאות סוכנים חזקות ומחיר נמוך מהמתחרים הישירים

מאת הדר מזרחי כתב/ת AgentNet
Grok 4.6 מגיע עם תוצאות סוכנים חזקות ומחיר נמוך מהמתחרים הישירים

Grok 4.6 יוצא והפעם הסיפור הוא לא גודל המודל אלא העבודה האגנטית המקצועית. המודל מוביל על GPT-5.6 Sol Max ועל Fable 5 Max בשני מדדים שבודקים משימות סוכן מהעולם האמיתי, ומתחרה בהם גם במחיר לטוקן.

המספרים מול המתחרים

במדד Artificial Analysis, שמשקלל יכולות כלליות, Grok 4.6 מגיע לניקוד 61, בדיוק כמו GPT-5.6 Sol Max. ההבדל הוא במחיר: 2 דולר למיליון טוקנים קלט ו-6 דולר למיליון טוקנים פלט. מול Fable 5 Max, שמתיימר להיות מודל הדגל בשוק, Grok 4.6 משיג 98.4% מהניקוד שלו במדד ה-Intelligence Index שלו, אבל במחיר זול פי 5 בקלט ופי 8 בפלט. זה אומר שמבחינת יחס בין ביצועים לעלות, המודל החדש משבש את הפינה היקרה של השוק.

עבודת סוכנים וקידוד

היתרון הברור ביותר של Grok 4.6 הוא במשימות סוכן מקצועיות. ב-GDPVal-AA v2 הוא מגיע ל-1753, וב-AA-Briefcase ל-1577, שניהם לפני Sol Max ו-Fable 5 Max. המדדים האלה לא בודקים שאלות סגורות אלא עבודת ידע אגנטית, כמו מחקר, ניתוח והפקת קבצים מרובים, מה שהופך את התוצאות לרלוונטיות יותר לשימוש מעבדה מאשר למבחן טריוויה. בקידוד התמונה מעורבת: 69.9% ב-CursorBench v3.2 מקדימים את ה-67.2% של Sol, אבל ב-DeepSWE וב-Terminal-Bench, Grok 4.6 נשאר מאחורי שני המתחרים.

מה שמאחורי השיפור

SpaceXAI מייחסת את הקפיצה למספר שינויים בתהליך האימון. הריצה הייתה ארוכה יותר, ובנוסף חברת האימון עברה על ערימת נתונים מחדש: נתיבי SFT (Supervised Fine-Tuning) נוצרו מחדש, נעשה סינון עקבות מבוסס מודל, ובוצע RL (Reinforcement Learning) אגנטי על פני קידוד, פיתוח ווב, CAD ואופטימיזציית קרנל. החברה מדווחת גם על בדיקות עצמיות רבות יותר על עקבות ארוכות, כאשר המודל בודק את עבודתו לפני שהוא ממשיך הלאה. המטרה המוצהרת היא לטפל בבעיית צבירת השגיאות שנוצרת לאורך שרשראות סוכן מרובות צעדים. כל הנתונים מגיעים מדיווח החברה וטרם נבדקו באופן עצמאי.