13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מוצרים

המודל של Meta מקבל חיים מקומיים: Muse Glimmer 30B רץ עכשיו ב-GGUF על llama.cpp

מאת הדר מזרחי כתב/ת AgentNet
המודל של Meta מקבל חיים מקומיים: Muse Glimmer 30B רץ עכשיו ב-GGUF על llama.cpp

הפרויקט Atomic-Chat שחרר גרסאות GGUF ראשונות של Muse Glimmer 30B, המודל המולטימודלי של Meta, שמאפשרות להריץ אותו לגמרי אופליין על חומרה מקומית. הקוונטיזציה נעשתה מהמשקולות המקוריות ב-BF16, והתמיכה מוזגה ל-llama.cpp במאסטר (קומיט 62bf73d, PR 26841), כך שצריך לבנות מהמקור או לחכות לבינארי לילי שמכיל את הקומיט הזה.

מה בקופסה

השלב הראשון כולל בסיס בדיוק מלא וגרסאות 8-ביט, כשהסולם המלא עם מטריצת חשיבות מכוילת ו-NVFP4 עדיין בעבודה. Q8_0 נכנס על RTX 5090 בודד ומספק 35.7 טוקנים לשנייה; הוספת ה-mmproj לקלט תמונה דוחפת לכרטיס שני. לנורמל יוז קייס ההמלצה היא Q8_0 או AD-Q8_0, שני הקבצים ב-experiments/ מבודדים טנזור גדול אחד כל אחד ב-BF16 ונועדו רק להשוואה. הרכב פר-טנזור של כל קובץ נמצא ב-layouts/*.json, והלוגים הגולמיים מאחורי כל מספר מפורסמים בריפו הייעודי.

הרצה בפועל

דגל `--jinja` חובה, בלעדיו תבנית הצ׳אט ופרסינג של קריאות כלי לא עובדים. דוגמה להרצה בסיסית:

```

llama-server -m Muse-Glimmer-30B-Q8_0.gguf \

--mmproj mmproj-Muse-Glimmer-30B-BF16.gguf \

--jinja -ngl 99 -c 16384 -fa on \

--temp 1.0 --top-p 0.95 --top-k 64

```

עומק החשיבה נשלט משורת פרומפט מערכת, `Reasoning strength: low|medium|high|xhigh`, כשברירת המחדל היא high. אין דגל נפרד.

דיקוד ספקולטיבי: יפה על הנייר, פחות במציאות

עם דרייפר DFlash ב-BF16 ההאצה בתיאוריה, אבל בבנצ׳מרק של 9 פרומפטים (קוד, פרוזה, ריזונינג) התקבל ספיד-אפ של 1.9x בלבד לעומת 3.1x ש-Meta מדווחת על 5090 בודד. הפער כנראה נובע מפיצול שכבות על 4 כרטיסים שהופך כל פורוורד של הטרגט ל-יקר יחסית לתקורת הדרייפר. שיעורי קבלה תלויים במשימה: קוד מגיע ל-0.37, פרוזה חופשית צונחת ל-0.12.

נאמנות למשקולות המקוריות

ה-BF16 GGUF של Atomic זהה ביט-לביט למשקולות המקור, אומת על ידי UUID וכל 731 האשים של הטנזורים. מדדי KL-divergence מול הרפרנס הזה מראים: בטקסט נייטרלי (30 שפות, 97 חלונות של 4096) PPL בסיס 5.4614; בדיאלוגים אגנטיים עם קריאות כלי (85 חלונות) PPL בסיס 2.4462. ככל שה-KLD נמוך יותר וה-top-1 גבוה יותר, הקוונטיזציה שמרה יותר מידע.

מטריצת חשיבות וכיול

הקובץ `imatrix/muse-glimmer.imatrix.gguf` פורסם כדי שכל אחד יוכל לשחזר את הקוונטים או לבנות משלו על אותו כיול. המטריצה רושמת לכל מטריצת משקולות את ממוצע ריבוע האקטיבציות בכל ערוץ קלט; הקוונטייזר משתמש בזה כדי לתת משקל לשחזור שגיאה בחיפוש סקאלות בלוק, שגיאה בערוץ שנושא אקטיבציות גדולות נענשת יותר. שני דגלים כבויים בברירת מחדל ושניהם קריטיים: בלי `--parse-special` טוקנים כמו `<|start|>` מתפרסים כפיסוק מילולי, אז 40% מהקורפוס היה מכויל על רצפים שהמודל לא מייצר; בלי `--process-output` ה-output.weight, 1.34 מיליארד פרמטרים שיושבים ישירות תחת הסופטקאפ של הלוגיטים, לא מקבל נתוני חשיבות.