SeedRealtime: ByteDance מאחדת ראייה, שמיעה ודיבור במודל אחד

צוות Seed של ByteDance חשף את SeedRealtime, מודל שפה גדול (LLM) שממזג אודיו, וידאו וטקסט בארכיטקטורה אחת. בניגוד למערכות זוויתיות שמחכות לתורן, המודל עובד על זרמי נתונים רציפים ומגיב בזמן אמת. המהלך מציב יעד חדש לכל מי שבונה מוצרי קול־פלוס־מצלמה, ומציע אלטרנטיבה ארכיטקטונית לתצורה המסורתית.
נגד ארכיטקטורת המפל
הטענה המרכזית של Seed ניצבת מול ארכיטקטורת המפל (cascade), שבה מודולי זיהוי דיבור (ASR), ראייה־שפה (VLM) וסינתזת דיבור (TTS) משורשרים זה לזה ומוסיפים השהיה בכל מעבר. במקום זאת, SeedRealtime מריץ תפיסה, הבנה, קבלת החלטות והבעה במקביל בתוך מודל קצה־לקצה (end-to-end) אחד. ניהול תורות הדיבור (turn-taking) עובר פנימה למודל, ומחליף את גלאי פעילות הקול (VAD) החיצוני שרוב מחסניות הזמן־אמת עדיין תלויות בו. Seed מדווח על שלושה פריצות: הבנה משולבת של שמע ותמונה, אינטראקציה יזומה, ותזמון שיחה טבעי.
מה באמת עושים הדמוים
Seed פרסם שבעה תרחישים, מהם ארבעה נושאי משקל. הראשון הוא קשירת זהות בין מודאליות: בארוחת ערב רועשת המודל מתאים שמות לפנים ושומר על קשר בין כל קול לזהותו, כך שהוא מייחס העדפות נסיעה סותרות לדובר הנכון. השני הוא דיבור יזום מהוראה שמורה: במוזיאון חביי המשתמש מבקש להיזכר כשמופיע כן מסך ברונזה מסוים, והמודל עוקב אחרי תנועת המצלמה וקולע הערה ללא התגרות כשהפריט נכנס לפריים. התנהגות דומה מופיעה עם מאמר ResNet, שבו המודל עוקב אחרי דפדוף מהיר, מזהה את סעיף 3.4, משהה את עצמו ומקריא את קצב הלמידה, התנע ודעיכת המשקל. השלישי הוא תיקון ממצב חזותי ולא משאלה: במעקב אחרי תהליך הכנת אספרסו המודל קוטע כשפולי קפה שלמים נכנסים לפורטפילטר, ואז קורא את צבע ונפח הקרמה ומציע לקצר את החליטה ב־2 עד 3 שניות. הרביעי הוא דיכוי הפרעות וזיכרון מחוץ למסך: בנמל התעופה בייג'ינג דאשינג, שיחות לא קשורות על טיסה לא מצמידות תשובה, וכשהמשתמש שואל המודל עונה ממידע לוח יציאות שכבר גלל מחוץ למסך ומתחבר לרשת לאיתור מסוע המזוודות.
מה חסר ומה פורסם
למרות ההילה, הפריסה מוגבלת. המודל פעיל בתוך Doubao, אפליקציית העוזר הצרכנית של ByteDance, אך לא פורסם דוח טכני, לא פורסמו מספר פרמטרים, אין משקלים פתוחים ואין נקודת קצה (endpoint) ב־Volcano Engine או BytePlus. כצוות חיצוני לא ניתן לשלב אותו נכון לעכשיו. מה שכן זמין הוא הרעיון: ארכיטקטורת ייחוס מאומתת והזזת קו השער לכל מי שמשווק מוצרי קול־פלוס־מצלמה בזמן אמת.
מדדים פנימיים בלבד
בהערכת אנוש פנימית של ByteDance נמסר על הפחתת בעיות קצב בחצאי לעומת מחסניות מפל, אך לא פורסם שום מבחן ביצועים חיצוני (benchmark) ולא מספרי השהיה. כלומר, הטענה על שיפור התזמון נשענת על מדידה פנימית של החברה בלבד, ולא ניתן לאמת אותה או להשוות אותה למודלים אחרים באופן עצמאי.