מודלים חדשים של Meta משולבים בדיפוזיה וב‑LLM

המעבר לשם Meta Superintelligence Lab מסמן את השחרור הראשון של Muse Image ו‑Muse Video, המשך ישיר של מודלי Emu, ומשלבים בתוכם רשת דיפוזיה צמודה למודל שפה גדול, כאשר חלק מהשכבות משותפות ביניהם. המודלים מסוגלים לכתוב קוד Python בעצמם ולסרוק את הרשת לקבלת רפרנסים, תכונה שכבר הופיעה ב‑Nano Banana. הצגת הדגמה הראתה איך Muse מייצרת קוד ליצירת פרקטל, משבץ אותו בתמונה – תרחיש שמיועד לאינפוגרפיקה – ולאחר מכן בונה גרף ב‑Python מתוך נתוני המשתמש וממקם אותו בתמונה או בתבנית HTML של תפריט מסעדה, כאשר המודל מבצע תיקון שגיאות בזמן רינדור על‑ידי בחירת הגרסה האופטימלית מבין מספר יצירות (Test‑Time‑Scaling). לפי המקור, הפונקציה האחרונה צמחה באופן אמרג'נטי במהלך אימון עם חיזוק.
ב‑t2i, Muse תפסה את המקום השני, אחרי NB2 ו‑Reve‑2, אך גרסת Reve‑2.1 שהושקה אתמול חצתה אותה. באירנה Image Edit Arena היא גם זכתה במיקום השני, קודמת במקצת ל‑MAI‑image‑2.5, שממנה עברו כמה מחברי הצוות הקודם של Meta. במקומות אחרים עדיין אין לה נוכחות.
הקונוטציה המפוקפקת של אפשרות לייצר תמונות של פרופילים אינסטגרם על‑פי תגיות @ נחשבה למעוררת מחלוקת, והציפייה שלא היה מרק זה יעלה על הדעת. מודל הווידאו, למרות שאין לו עדיין סוכנים, נכנס ל‑top‑3 בלידרבורדים, עקף את happyhorse של Alibaba. ניתן להתנסות במודל דרך הא arena, אך כרגע זמינותו מוגבלת לאינסטגרם האמריקאית, והפצה לאירופה מתבצעת באיטיות.
@ai_newz