13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מודלים

NVIDIA משיקה את Nemotron 3.5 Lightning: מודל היברידי Mamba-MoE עם 3 ביליון פרמטרים פעילים

מאת הדר מזרחי כתב/ת AgentNet
NVIDIA משיקה את Nemotron 3.5 Lightning: מודל היברידי Mamba-MoE עם 3 ביליון פרמטרים פעילים

NVIDIA שחררה אתמול את Nemotron 3.5 Lightning, מודל שפה במשקל 30 ביליון פרמטרים כולל, שמפעיל רק 3 ביליון בכל העברה קדימה (forward pass). הארכיטקטורה היברידית: שכבות Mamba-2 ו-MoE לסירוגין, בתוספת שכבות Attention נבחרות. המודל מגיע עם משקולות, נתוני אימון ומתכוני אימון (recipes) תחת רישיון OpenMDW-1.1, וזמין להורדה מיידית ב-Hugging Face. NVIDIA מגדירה אותו כמוכן לשימוש מסחרי.

ארכיטקטורה: Mamba-2 פוגש MoE

הבחירה ב-Mamba-2 לצד MoE אינה מקרית. Mamba-2 מציע סיבוכיות ליניארית באורך ההקשר, בעוד MoE שומר על עלות הסקה קבועה דרך הפעלה דלילה של מומחים. השילוב נועד לתת חלון הקשר ארוך בלי לשלם ריבועית ב-attention. NVIDIA מוסיפה גם Multi-Token Prediction (MTP), חיזוי כמה טוקנים קדימה בכל צעד, כדי להאיץ יצירת טקסט ספקולטיבית. הנתונים הטריים ביותר באימון: קדם-אימון עד ספטמבר 2025, פוסט-אימון עד מאי 2026.

בנצ'מרקים: נמדדו ב-NeMo Gym, לא בדיווח עצמי

NVIDIA מדווחת תוצאות על סוויטה רחבה, ידע והסקה, הוראות, קוד, סוכנים (agentic), שימוש בכלים, והקשר ארוך, כולן נמדדו בהרתמה (harness) אחידה של NeMo Gym / NeMo Evaluator SDK. החברה מציינת במפורש שהמספרים עשויים להשתנות ממספרי היצרנים עצמם, ומפרסמת את מתכוני ההערכה המלאים לשחזור. תוצאות SWE-Bench Verified ו-Terminal-Bench 2.1 כלולות גם הן. כל המספרים מתייחסים לצ'קפוינט NVFP4 הרשמי בלבד.

פריסה מעשית: מכוון ל-DGX Spark עם vLLM

מדריך ההפעלה המהיר מכוון ישירות ל-DGX Spark (שבב GB10) עם vLLM nightly. המתכון כולל: backend מסוג Marlin ל-MoE, מטמון KV ב-FP8, קידוד קידומות (prefix caching), פענוח ספקולטיבי עם 3 טוקנים, backend של FlashInfer ל-Mamba, ו-parsers ייעודיים להסקה (nemotron_v3) ולקריאות כלים (qwen3_coder). NVIDIA מספקת גם צ'קפוינט ייעודי ל-DSpark speculative decoding. בקיצור: המודל תוכנן מראש להרצה יעילה על חומרת NVIDIA העדכנית.

רישיון ושפות: OpenMDW-1.1, תמיכה רב-לשונית

הרישיון OpenMDW-1.1 מאפשר שימוש מסחרי, פרט חשוב לצוותים שבונים מוצרים. המודל מיועד לאנגלית ושפות קוד, עם תמיכה מוצהרת בספרדית, צרפתית, גרמנית, איטלקית ויפנית. הייעוד המוצהר: מערכות סוכני AI, צ'טבוטים, RAG, ויישומי AI כלליים. נותר לראות איך הביצועים בפועל משתווים למודלים פתוחים מקבילים (Qwen3, Llama 3.3) כשהקהילה תריץ הערכות עצמאיות מחוץ להרתמה של NVIDIA.