NVIDIA משחררת מודל קול־לקול פתוח שמאזין תוך כדי דיבור, אבל מתפרק אחרי כמה תורות

NVIDIA שחררה את NemotronLabs VoiceChat 11B, מודל end-to-end פתוח לדיבור בזמן אמת שמבצע הבנה ויצירה של דיבור בזרימה רציפה ברשת אחת מאוחדת, בלי לשרשר זיהוי דיבור (ASR), מודל שפה (LLM) וסינתזה (TTS). המעבר הזה מסיר את תזמון המודלים והעברות ה־API ששרשרת קסקדה דורשת ומקצר את ההשהיה מקצה לקצה. המודל מאזין תוך כדי דיבור, כך שמשתמש יכול לקטוע אותו באמצע תור והסוכן נכנע, עם יחס קטיעה מלא (TOR 1.00) ב־480 מילישניות. זהו גם מודל ה־full-duplex הפתוח הראשון שתומך בקריאת כלים (tool calling) תוך כדי שהשיחה ממשיכה לזרום, באמצעות ערוץ פלט נפרד לסקריפטים של <TOOLCALL> יחד עם שורות "המתנה" שמפעיל המערכת מגדיר מראש, שממלאות את הרווח בזמן ש־API רץ.
הארכיטקטורה היא היברידית מסוג Mamba/Transformer, מורכבת משלושה רכיבים קיימים של NVIDIA יחד עם נתיב פלט חדש. מקודד הדיבור Fast Conformer מ־Nemotron-Speech-Streaming-En-0.6b מקודד זרם קול נכנס ב־16 kHz ברציפות. עמוד השדרה של מודל השפה Nemotron Nano v2 צורך טוקנים של אודיו וחוזה טוקנים של טקסט. מפענח ומקודד ה־TTS חוזה קודי אודיו המומרים לדיבור סוכן ב־22.05 kHz, ובנוסף יש ערוץ פלט נפרד המוקדש לסקריפטים של קריאת כלים. הפלטים כוללים אודיו של הסוכן, טקסט של הסוכן ותמלול משתמש רץ. האימון השתמש בכ־550 אלף שעות אודיו על פני קורפוסים אמיתיים וסינתטיים, תוך הסתמכות על המודלים SALM-Duplex ו־Audio Flamingo 3.
קריאות כלים משודרות בערוץ הצדדי כבלוק <TOOLCALL>, והקוד שלכם מחזיר תוצאות בבלוק <TOOL_RESPONSE>. החלק המעניין הוא הודעת ההמתנה: לכל כלי, המפעיל מגדיר משפט שהסוכן אומר ברגע שהמודל מייצר את הטקסט שמפעיל את הקריאה, כך שהשיחה לא משתתקת בזמן ש־API רץ. המגבלות מפורשות: NVIDIA ממליצה על מקסימום חמישה כלים לכל סשן, המודל לא יכול לקרוא למספר כלים בו־זמנית באופן אמין, והמשתמש לא יכול לקטוע את הסוכן בזמן ביצוע הכלי. פרומפטים של המערכת ותגובות הכלים חייבים להיות ASCII בלבד וידידותיים ל־TTS.
במדד Full-Duplex-Bench 1.0 נמדדה השהיית תור חלקה של 448 מילישניות עם TOR 0.82, קטיעת משתמש ב־TOR 1.00 ב־480 מילישניות, וטיפול בהפסקות עם TOR 0.153 (סינתטי) ו־0.255 (Candor), כאשר נמוך יותר עדיף. במדד AU Harness BFCL-v3 לקריאת כלים קולית נרשמו 58.5% לקריאות פשוטות, 62.5% למרובות, 42.5% למקבילות, 27.5% למקבילות־מרובות, 89.6% לאי־רלוונטיות וממוצע 56.1%. ב־Full-Duplex-Bench v3 נמדדו 82.5% בבחירת כלים, 44.2% בדיוק ארגומנטים ו־33% ב־pass@1. NVIDIA מדווחת שהמודל מדורג שני.