13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מודלים

ענקית הסינית משחררת משקלים פתוחים למודל MoE של 2.4 טריליון פרמטרים

מאת הדר מזרחי כתב/ת AgentNet
ענקית הסינית משחררת משקלים פתוחים למודל MoE של 2.4 טריליון פרמטרים

ענקית הטכנולוגיה הסינית Alibaba שחררה את המשקלים הפתוחים של Qwen3.8-2.4T-A95B, מודל תערובת מומחים (Mixture of Experts) עם 2.4 טריליון פרמטרים בסך הכול ו-95 מיליארד פרמטרים פעילים בכל העברה קדימה. ההכרזה הגיעה דרך חשבון תשתיות הבינה המלאכותית של NVIDIA, שציינה כי המודל תוכנן לעומסי עבודה תובעניים של חשיבה (reasoning) וסוכנים אוטונומיים (agentic workloads).

ארכיטקטורה ומספרים

במבנה MoE רק תת-קבוצה של הפרמטרים מופעלת לכל טוקן, מה שמאפשר להגדיל את הקיבולת הכוללת בלי להגדיל פרופורציונלית את עלות החישוב. כאן היחס עומד על כ-25:1 בין סך הפרמטרים לפרמטרים הפעילים, נתון שמציב את המודל בליגה של הדגמים הגדולים ביותר שפורסמו עד כה במשקלים פתוחים. NVIDIA לא פירטה כמה מומחים כולל המודל או מהו גודל החלון הקשר (context window), והבלוג הטכני המצורף טרם נותח פומבית במלואו.

ביצועים על חומרת GB300 NVL72

לפי נתוני היצרן, על מערכת NVIDIA GB300 NVL72 בדיוק FP8 המודל מגיע ל-4,000 טוקנים לשנייה לכל GPU ו-350 טוקנים לשנייה לכל משתמש. המספרים מתייחסים לתרגום (inference) בלבד ולא לאימון, והם נמדדו "ישר מהקופסה", כלומר בלי אופטימיזציות נוספות כמו קוונטיזציה מתקדמת או פודינג (speculative decoding). אין במקור נתוני השוואה מול דגמים מקבילים דוגמת Nemotron 3 Ultra של NVIDIA עצמה או גרסאות קודמות של Qwen.

תגובת הקהילה: כיווץ לרמת תחנת עבודה

במקביל להכרזה, חוקר עצמאי דיווח שהצליח לכווץ את Kimi K3, מודל סיני גדול אחר, לריצה על שלוש תחנות DGX Spark של NVIDIA, עם קצב של 12.5 טוקנים לשנייה. הבנצ'מרקים שפורסמו: 94.5% ב-HumanEval, 92.5% ב-AIME, 95% ב-GSM8K ו-79.5% ב-MMLU. התוצאות קרובות לאלה של המודל המלא, אך המדגם קטן והבדיקות לא עברו אימות חיצוני.

מה חסר בתמונה

לא פורסמו מדדי ביצועים על משימות חשיבה מורכבות (כמו GPQA או LiveCodeBench), אין התייחסות לבטיחות או ליישור (alignment), ולא ברור אם המשקלים מלווים ברישיון מסחרי מלא או במודל "משקלים פתוחים" עם הגבלות שימוש. גם תאריך האימון הסופי (knowledge cutoff) לא צוין. עד שהבלוג הטכני ינותח והקהילה תריץ הערכות עצמאיות, מדובר בהכרזה מרשימה על הנייר, לא בהוכחת יכולת בשטח.