13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מודלים

קוהיר משיקה מודל ראייה זעיר עם רזולוציה מקורית ומשקלים פתוחים

מאת הדר מזרחי כתב/ת AgentNet
קוהיר משיקה מודל ראייה זעיר עם רזולוציה מקורית ומשקלים פתוחים

קוהיר (Cohere) משחררת את North-Micro-Vision-Instruct, מודל שפה-ראייה (VLM) של 2.4 מיליארד פרמטרים ברישיון Apache 2.0, שמגיע עם תמיכה ברזולוציה מקורית של תמונות, כלומר בלי לדחוס כל קלט לריבוע קטן ולאבד פרטים של מסמכים, טבלאות או צילומי מסך. המודל עוקף את Gemma 4 E2B ואת Ministral 3 3B במבחני הבנת ראייה כלליים, ורושם תוצאות חזקות במיוחד בהבנת מסמכים ומענה ויזואלי (Visual Q&A).

ארכיטקטורה בשלושה חלקים

המודל בנוי ממקודד ראייה (vision encoder) מותאם של 400 מיליון פרמטרים שתומך ברזולוציה מקורית, מקרין (projector) שממפה תכונות ויזואליות למרחב ההטמעות של מודל השפה, ומודל שפה קומפקטי של 2 מיליארד פרמטרים בשם North Micro LLM. מודל השפה עוקב אחרי ארכיטקטורת Command A+ של קוהיר, עם שלוש שכבות קשב חלון-הזזה (sliding-window attention) שמשתמשות בהטמעות מיקום סיבוביות (RoPE) ושכבת קשב גלובלית אחת בלי הטמעות מיקום. המקודד משלב 2D RoPE עם הטמעות מיקום 1D נלמדות כדי לשמר מבנה מרחבי בקלטים ברזולוציה מלאה.

גישת DeepStack במקרין

המקרין מיישם את שיטת DeepStack: הטמעות טלאים (patches) ממספר שכבות של מקודד הראייה מוזרקות לשכבות מוקדמות מקבילות במודל השפה, כך שהמודל מקבל ייצוגים ויזואליים ברמות הפשטה שונות כבר בשלבים המוקדמים של העיבוד. זו בחירה ארכיטקטונית שנועדה לשפר הבנה של פרטים עדינים במסמכים ותרשימים בלי להגדיל דרמטית את מספר הפרמטרים.

ארבעה שלבי אימון עם תוכנית לימודים מדורגת

האימון התנהל בארבעה שלבים, כששלב 2 פוצל לשני שלבי רזולוציה: שלב 1 התאים את המקודד והמקרין; שלבים 2.1 ו-2.2 העלו רזולוציה ואורך הקשר תוך אימון משותף של כל הרכיבים; שלב 3 ביצע כוונון הוראות (instruction tuning) למודל המלא; ושלב 4 השתמש בגרסה מפושטת של Mixed Preference Optimization (MPO) לשיפור בטיחות, עיצוב תגובה ואיכות כללית. מקודד הראייה המשיך אימון מוקדם מהצ'קפוינט SigLIP 2 SO400M של גוגל, עם תוכנית לימודים שהעלתה בהדרגה רזולוציה ואורך הקשר ושילבה C-RoPE, שילוב של 2D RoPE עם הטמעות 1D מבולבלות ליניארית.

פריסה מקומית ומכשירי קצה

הגודל של 2.4 מיליארד פרמטרים הופך את המודל למועמד טבעי לכוונון עדין (fine-tuning) על דאטה ייעודי ולהרצה על חומרה מקומית, לפטופים, התקני קצה (edge) ומובייל, בתנאי שיש סט הסקה (inference stack) מתאים וקוונטיזציה. בקוהיר מציינים ש-vLLM ציבורי יגיע בקרוב. המשקלים זמינים כבר עכשיו ב-Hugging Face תחת CohereLabs/North-Micro-Vision-Instruct.

חלק מאסטרטגיית AI ריבוני

השחרור משקף את העבודה הרחבה יותר של קוהיר על AI ריבוני (sovereign AI): פיתוח מודל לצד רישוי ברור, משקלים פתוחים והערכה שקופה. בניגוד למודלים סגורים או כאלה שמשוחררים בלי פירוט מתודולוגיית הבנצ'מרק, כאן קוהיר מפרסמת את פירוט המבחנים והתוצאות מול המתחרים הישירים בקטגוריית הקומפקטיות. עבור מפתחים ישראלים שבונים יישומים מולטימודליים בעברית או בערבית וצריכים שליטה מלאה במודל בלי תלות ב-API חיצוני, זהו כלי ששווה לבחון מקרוב, במיוחד כשהדרישה היא עיבוד מסמכים מורכבים על חומרה מקומית.