Meta דוחפת מודל 30B לכרטיס מצרכני אחד ומאיימת על ענן ה-API

Meta Superintelligence Labs שחררה את Muse Glimmer, מודל שפה בעל 30 מיליארד פרמטרים שמיועד לריצה רציפה על כרטיס מסך בודד לגיימינג. המודל זמין בחינם עם משקלות בפלטפורמת HuggingFace תחת רישיון Apache 2.0, מה שמעמיד בלחץ ישיר שחקנים מבוססי ענן. מודל שמסוגל לרוץ על מחשב ביתי יכול להחליף חלק ניכר מהמנויים החודשיים שמשלמים משתמשים היום על גישה ל-API.
כיווץ שמשאיר מקום לנשימה
בדיוק מלא המודל היה דורש מעל 55 ג'יגה-בייט של זיכרון, מה שהופך אותו לבלתי רלוונטי לחומרת צרכן סטנדרטית. Meta דחסה את המשקלות לרמת דיוק של כ-4 ביט, ובכך צמצמה את גודל המודל למתחת ל-20 ג'יגה-בייט. הצעד הזה משאיר מספיק מקום בתוך מעטפת זיכרון של 24 או 32 ג'יגה-בייט עבור רכיבי עזר קריטיים, כולל KV cache, מקודד תפיסה לצילומי מסך, ומודל עזר לפענוח ספקולטיבי.
ביצועים מול המתחרים
על גבי מדד הביצועים MCP Atlas, המודל המכווץ מוביל את המתחרים עם ציון 75.5, לעומת 54.2 ל-Gemma4-31B ו-62.5 ל-Qwen3.6-27B. עם זאת, היתרון מתהפך במשימות שליטה במחשב וכתיבת קוד בטרמינל, שם Qwen3.6-27B מקבל ציונים גבוהים יותר במדדים OSWorld-Verified, TerminalBench 2.1 ו-SWE-Bench Verified. המשמעות היא שהמודל חזק במשימות הסקה כלליות אך מפגר מול המתחרים בעבודה טכנית ישירה על מערכת ההפעלה.
פענוח ספקולטיבי על חומרת אפל
במקום לכתוב מילה אחת בכל פעם, Muse Glimmer משתמש ברשת עזר קטנה בשם DFlash שמנחשת בלוק שלם של טוקנים קדימה. המודל הראשי מאמת את הבלוק הזה במעבר אחד, מקבל את הניחושים הנכונים ומתקן את השגויים. על כרטיס RTX-5090 של NVIDIA, השיטה הזו האיצה את מהירות הפענוח מ-74.9 ל-233 טוקנים לשנייה, שיפור פי 3.1 שנמדד דרך סביבת ההרצה llama.cpp.
פער חומרה משמעותי
חומרת אפל מרוויחה פחות מהטכניקה הזו. על מעבד M5-Max יש שיפור של פי 1.8 למהירות של 50 טוקנים לשנייה, ועל M4-Max שיפור של פי 1.5 ל-38 טוקנים לשנייה. הפענוח הספקולטיבי משתלם הרבה יותר על כרטיס מסך שולחני מאשר על מחשב Mac, כאשר המכונה של אפל זזה מ-23.7 טוקנים לשנייה ל-38, לעומת הקפיצה החדה של NVIDIA. המסקנה הפרקטית ברורה: מי שרוצה להריץ את המודל הזה במלוא יכולתו צריך להתחבר לחומרת גיימינג ולא לארכיטקטורה של אפל.