GPT
M

Mage-VL

קוד פתוח

microsoftapache-2.02026-07-25

  • transformers
  • safetensors
  • mage_vl
  • image-text-to-text
  • multimodal

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל מולטימודלי של מיקרוסופט בגודל 4.7B, שמעבד וידאו דרך נתוני דחיסה של קודק במקום דגימת פריימים רגילה, כולל שער מובנה לזיהוי אירועים בשידור חי.

  • 4.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 10.1 GBמשקל הקבצים
  • 37,826הורדות בחודש

מה זה

מיקרוסופט בנו כאן מודל שמנסה לפתור את בעיית המהירות של עיבוד וידאו. במקום לפרוס וידאו להמון תמונות ולשלוח את כולן לעיבוד כבד, המודל מתחבר ישירות למבנה של קודקים כמו H.264 או DCVC-RT. הוא שומר את כל המידע רק מפריימים מרכזיים, ומפריימים עוקבים הוא לוקח רק אזורים שבהם יש תנועה. החיבור הזה חותך מעל 75% מכמות הטוקנים הוויזואליים ומאיץ את הריצה עד פי 3.5 מול דגימת פריימים רגילה.

המערכת מורכבת מאינקודר ויזואלי בשם Mage-ViT שאומן מאפס על כ־100 מיליון תמונות וסרטונים לא מתויגים, ומודל שפה של Qwen3-4B. מעליהם הוסיפו מנגנון סינון שמחליט בעצמו מתי לשתוק ומתי להגיב לאירוע בשידור. במבחני זיהוי זמני בווידאו כמו QVHighlight המודל הגיע לציון של 57.4 לעומת 34.9 ב־Qwen3-VL המקביל, ובתחום הראייה המרחבית הוא עוקף אותו בעקביות, למשל ב־VSI-Bench עם 64.3 מול 53.3.

מתאים ל

  • פרשנות שידורי ספורט חיים

    מנגנון הסינון הפנימי שותק במהלך מהלכים שגרתיים ומגיב רק כשיש אירוע ממשי בשידור.

  • איתור קטעים בסרטונים ארוכים

    הורדת כמות הטוקנים ב־75% מקלה על סריקת ציר זמן שלם ומציאת רגעים ספציפיים.

  • ניתוח מצלמות אבטחה ברשת

    התממשקות ישירה לזרם וידאו מקודד חוסכת פריסה כבדה של פריימים על השרת.

איפה זה נופל

בזיהוי טקסט ותמונות מסמכים סטנדרטיות, המודל לא מציג יתרון ולפעמים אפילו מפסיד לחלופות. במבחן CC-OCR למסמכים הוא קיבל ציון של 32.25 לעומת 39.69 ב־Qwen3-VL-4B, וב־TextVQA הוא הגיע ל־77.28 מול 80.55.

המגבלה הכי גדולה היא התלות בקודק של הווידאו עצמו. המנגנון נשען על איכות וקטורי התנועה של הקובץ או על מנוע עצבי נפרד, מה שאומר שסרטונים מקודדים גרוע, רעש דיגיטלי, או פורמטים חריגים יפגעו בדיוק של שליפת המידע. בנוסף, מנגנון השער האוטומטי להזרמת וידאו אומן על נתונים ספציפיים ודורש כוונון סף מדויק, אחרת הוא מייצר התראות שווא או מחמיץ אירועים לחלוטין.

שאלות
נפוצות

האם המודל שונה מגרסת Mage-ViT שפורסמה לצדו?

כן, Mage-ViT הוא רק האינקודר הוויזואלי הנקי שאומן על פריימים ולא עבר אימון עם מודל שפה. Mage-VL כולל את המערכת המלאה עם מודל השפה של Qwen3, מקרן הטוקנים והשער האוטומטי לשידורים.

אפשר להזין לו וידאו רגיל בלי להשתמש במנגנון הקודק?

כן, הסקריפטים תומכים במצב של דגימת פריימים אחידה. עם זאת, במצב הזה מוותרים על היתרון המרכזי של הכלי, שהוא מהירות עיבוד גבוהה וחיסכון ניכר בכמות הטוקנים.

איך מריצים

המשקלים תופסים כ־10.1 גיגה-בייט, כך שכרטיס מסך בודד עם 16 גיגה זיכרון יספיק לטעינה פשוטה של המודל, אם כי ניצול של חלון ההקשר המלא ידרוש כרטיס חזק בהרבה או חלוקה לכמה מעבדים גרפיים. הרצה מקומית דורשת גרסת transformers עדכנית, תוכנות ffmpeg ו־ffprobe זמינות במערכת, וחבילות ייעודיות כמו codec-video-prep כדי לנתח את הקודק.

לשימוש פרודקשן עם שרת מהיר, צריך להרים את הפיצול הייעודי של SGLang שנבנה עם תמיכה ב־Mage-VL, תהליך שדורש כלי פיתוח של Rust ומהדר של protobuf. אם אתם צריכים רק תיאור של תמונות סטטיות בודדות, אין שום סיבה להסתבך עם התלויות האלה ועדיף לקרוא לכל מודל ראייה סטנדרטי דרך API חיצוני קיים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="microsoft/Mage-VL")
print(pipe("שלום"))

הקבצים

78 קבצים במאגר, 10.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המאפשר שימוש מסחרי חופשי, הפצה, שינוי קוד והטמעה במוצרים סגורים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ועותק של הרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗