MiniMax פתחה את VTP ומאתגרת את ההנחה המקובלת במודלי Latent Diffusion

צוות הווידאו של MiniMax, המוכר גם במותג Hailuo, הודיע על פתיחת VTP (Visual Tokenizer Pre-training) לקהילה. מדובר במסגרת אימון מקדים מדרגית לטוקנייזרים חזותיים, שנבנתה עבור מודלי יצירה מהדור הבא. ההכרזה מאתגרת הנחה מרכזית במודלי Latent Diffusion, לפיה הגדלת המשאבים של הטוקנייזר החזותי בשלב הראשון, בין אם בכמות המידע, בכוח המחשוב או בגודל המודל, אינה משפרת את איכות היצירה בשלב השני של הפריימים.
הצוות טוען שהמחקר שלו סותר הנחה זו. השיטה שפיתחו משלבת למידת ייצוג יחד עם דחיסה ושחזור, ומציגה לראשונה עקומת מדרגיות שמקשרת בין הגדלת הטוקנייזר לבין שיפור התוצאות של מודלי Diffusion Transformers. הטענה המרכזית היא שהשיפור באיכות הפריימים מושג אך ורק באמצעות השקעת משאבים באימון הטוקנייזר, בלי להוסיף עומס חישובי למודל המחולל עצמו בזמן ריצה. במילים אחרות, אפשר לקבל ייצוג מרחבי עשיר יותר של המידע החזותי עוד לפני שהמודל הסופי מתחיל לעבוד, כך שהמחולל לא משלם קנס ביצועים בזמן אמת. הפרסום נחת בתזמון של ברכת חג מולד מוקדמת לקהילה.
טענות גדולות, הוכחות עדיין חסרות.