מיקרוסופט משיקה שני דגמי MAI חדשים ודוחפת אותם לכל המוצרים המרכזיים

הדור הבא של מולטי־מודל בבית
מיקרוסופט לא מחכה לאף אחד. חטיבת ה-AI של החברה השיקה השבוע שני דגמים חדשים במשפחת MAI, MAI-Image-2.5-Pro לייצור תמונות ו-MAI-Voice-2-Flash לסינתזת דיבור, ושניהם כבר זמינים ב-Azure AI Foundry להתנסות מיידית ב-MAI Playground. המהלך מסמן מעבר חד ממודלים של שותפים חיצוניים לטכנולוגיה ביתית שמריצה את השירותים הכי נפוצים של הענקית מרדמונד.
תמונות: איכות טקסט ומחיר שמדבר למפתחים
MAI-Image-2.5-Pro מוצג כמודל הגרפי האיכותי ביותר של מיקרוסופט למשימות שדורשות פירוט גבוה ורינדור מדויק של טקסט בתוך התמונה, נקודת כאב קלאסית בדגמי דיפוזיה קודמים. התמחור נקבע על 5 דולר למיליון טוקני טקסט נכנסים (כ-18.5 שקל), 8 דולר למיליון טוקני תמונה נכנסים (כ-30 שקל) ו-106 דולר למיליון טוקנים יוצאים (כ-392 שקל). ב-Bing Image Creator המודל כבר תפס פיקוד מלא, וב-PowerPoint הוא מחליף את GPT-Image-2 בעריכת תמונות, מהלך שחתך את עלויות החישוב ב-84 אחוז. ב-OneDrive מדווחים על עלייה של 26 אחוז בתוצאות שמשתמשים שמרו, לצד קיצור זמן התגובה בכרבע.
קול: מהירות וחיסכון במוקדי שירות
בגזרת האודיו, MAI-Voice-2-Flash נבנה למהירות, פי שניים מהדור הקודם MAI-Voice-2, ועולה 32 אחוז פחות: 15 דולר למיליון תווים (כ-55.5 שקל). המודל כבר מחובר ל-Dynamics 365 Contact Center, שם מיקרוסופט מצהירה על חיסכון של עד 89 אחוז בעלויות חישוב. במקביל, MAI-Transcribe-1.5 תפס את מקומו ב-Dragon Copilot, ובמרבית 58 השפות הנתמכות שיעור השגיאות בזיהוי דיבור ובזיהוי שפה נחתך בחצי.
המשמעות: שליטה מלאה בסטאק
התמונה הכוללת ברורה: מיקרוסופט מחליפה רכיבי ליבה במוצרי הדגל שלה בדגמים תוצרת בית, חוסכת עשרות אחוזים בעלויות תשתית ומקצרת זמני תגובה למשתמשי קצה. למפתחים זה אומר API יציב יותר עם תמחור צפוי, ולארגונים, פחות תלות בספקי צד שלישי כשהעומסים גדלים.