דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי

החוקר שמאחורי המודל
דינה רובוטיקס (Dyna Robotics) הכריזה על דינה-2 (Dyna-2), מודל עולם-פעולה (World-Action Model, WAM) שפותח מראש על יותר ממיליון שעות של וידאו אגוצנטרי אנושי, המקבילה לכ-170 שנות ערות רצופות. המודל בוחן אם וידאו אנושי רגיל, ללא תיוג פעולות, יכול להחליף את צוואר הבקבוק המסורתי בלמידת רובוטיקה: נתוני פעולות שדורשים טל-אופרציה יקרה ואיטית. החברה לא פרסמה נקודת בדיקה ציבורית, API או רישיון; פריסה היום פירושה רכישת תא רובוט של דינה, לא הרצה מקומית של המשקולות.
ארכיטקטורה: הפרדה בין וידאו לפעולה
ארכיטקטונית, דינה-2 בנוי כתערובת טרנספורמרים (mixture of transformers). וידאו ופעולות מטוקנים בנפרד ומקבלים ערימות שכבות DiT נפרדות שמקשיבות זו לזו; פרופריוספציה מוזנת ישירות לטרנספורמר הפעולות. טוקני וידאו משתמשים במסיכה סיבתית (causal masking), טוקני פעולות בקשב עצמי דו-כיווני ומקשיבים לטוקני וידאו של ההקשר. טוקני וידאו מבצעים cross-attention לטקסט, אבל טקסט לא משפיע ישירות על טוקני פעולות. האימון משתמש ב-flow matching: הפסד וידאו והפסד פעולות חולקים גזע משותף כשני שדות מהירות שוליים נפרדים. מכיוון שרשת הפעולות לעולם לא מקבלת את הלטנט המנוזז של הווידאו כארגומנט, המדיניות נשארת ריאקטיבית בהרצה, היא לא מייצרת ולא מקשיבה לווידאו עתידי חזוי. טרנספורמר הפעולות רדוד בכוונה ומצטרף לזרם הווידאו מוקדם, מה שלדברי הצוות משפר השהייה בזמן אמת בלי לפגוע בביצועים.
חוקי קנה-מידה שעוברים מרובוט לאדם
הצוות גזר תת-קבוצות מקוננות של בדיוק 1,000, 10,000, 100,000 ומיליון שעות, תוך שמירה על פרופורציות זהות מכל מקור, כך שהבדלים בעקומות לא נובעים מהסטת התפלגות. סט ולידציה קבוע ומנותק של 100 שעות ניקד כל שלב. על נתונים אנושיים נמצא חוק חזקה: MSE שמור יורד כ-0.0691·D^-0.0184 (R²=0.919) ו-[email protected] עולה כ-0.357·D^+0.0203 (R²=0.865). לאורך הסולם, [email protected] משתפר ב-51% לעומת 12% בלבד ל-MSE. אותו חוק עובר אפס-שוט (zero-shot) לנתוני רובוט שהמודל לא ראה: 39 משימות על שתי פלטפורמות YAM דו-זרועיות נייחות, 12 פנימיות, 27 מ-xdof ABC. MSE פעולות אפס-שוט = 0.306·D^-0.0713 (R²=0.884), עם נקודת פיתול בין 10,000 ל-100,000 שעות.
הווידאו הוא ציר נפרד, לא רק תוספת
המטרה קובעת: דינואיזציה משותפת (joint denoising) ניצחה אימון פעולות בלבד ב-39 מ-39 משימות בכל קנה מידה של פעולות. כשמחזיקים נתוני פעולות מתויגים קבועים ב-50,000 שעות ומוסיפים שעות וידאו בלבד, MSE אפס-שוט של רובוט צונח מ-0.340 ל-0.120. כלומר, וידאו בלתי מתויג אינו רק רעש רקע, הוא ציר אימון עצמאי שדוחף את ההעברה קדימה.
לא למעבדה, לא לבונה הבודד
דינה-1 כבר רצה בייצור בבתי מלון, מסעדות ומכבסות, לפי הכרזת החברה מ-10 באוגוסט 2026. זה מכוון למפעילי שירות בינוניים וארגונים מרובי-אתרים עם עבודות מניפולציה נייחות חוזרות: אירוח, כביסה מסחרית, שירותי מזון, הרכבה ואריזה קלה, ניקיון מתקנים. 14 משימות הפוסט-אימון ממפות ישירות לעבודה אמיתית: פינוי מגשי אשפה, ערכות עזרה ראשונה, בניית טוטים, גריפת מזון, קשירת חבלים, הכנת קולבים, ושליפת משקה ממוקד ממקרר. לבונה הבודד או למעבדת מחקר שרוצה הסקה מקומית, זה לא המוצר.