GPT
M

MOSS-VL-Instruct-0408

קוד פתוח

OpenMOSS-Teamapache-2.02026-04-07

  • transformers
  • safetensors
  • moss_vl
  • feature-extraction
  • SFT

מודל מולטימודלי של 11 מיליארד פרמטרים שמנתח סרטונים ותמונות ברצף ארוך. הוא מזריק חותמות זמן מדויקות לכל פריים כדי להבין מתי קרו דברים בציר הזמן.

  • 11Bפרמטרים
  • 262,144טוקנים בהקשר
  • 21.1 GBמשקל הקבצים
  • 10,963הורדות בחודש

מה זה

הארכיטקטורה של המודל מפרידה בין עיבוד הווידאו לחשיבה הטקסטואלית דרך מנגנון קרוס אטנשן, מה שנועד להוריד את זמני התגובה בעיבוד רצפים דינמיים. הוא תומך בהזנה משולבת של תמונות וסרטונים בתוך חלון הקשר עצום של 262,144 טוקנים, כך שאין צורך לחתוך את המדיה למקטעים קצרים לפני השליחה.

במבחני ביצועים לווידאו הוא מציג ציון של 65.8, ועוקף את Qwen3-VL-8B-Instruct בבנצ'מרקים של הבנת פעולות וזמנים כמו VideoMME ו־VSI-bench, שם הוא מוביל בפער של 8.3 נקודות. במשימות OCR ומסמכים הוא קיבל ציון של 83.9, שמספיק לחילוץ טקסט סטנדרטי אבל מראה שההתמקדות העיקרית שלו נשארה תנועה ווידאו.

מתאים ל

  • איתור אירועים בווידאו

    זיהוי מדויק של פעולות לפי שניות בתוך הקלט, בזכות הזרקת חותמות זמן ישירות לפריימים.

  • ניתוח רצפי וידאו ארוכים

    חלון הקשר של 262 אלף טוקנים מאפשר לסרוק סרטונים מלאים בלי לחלק אותם לקבצים נפרדים.

  • חילוץ מידע ממסמכים מצולמים

    יכולת OCR עם ציון 83.9 שמתאימה לקריאת טקסטים מתוך תמונות ומסמכים באנגלית ובסינית.

איפה זה נופל

היוצרים מציינים במפורש שהמודל חלש במשימות של מתמטיקה וכתיבת קוד, בייחוד כשמשלבים אותן עם קלט חזותי. כמו כן, מדובר בגרסת כוונון עדין ראשונית בלבד ללא שלב יישור באמצעות למידת חיזוק, כך שהוא עלול לפספס שרשראות חשיבה מורכבות במספר שלבים. בנוסף, התמיכה המוצהרת היא באנגלית ובסינית בלבד, ולכן בדיקות עם טקסט או שמע בעברית דורשות זהירות מראש.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא עשוי לקלוט עברית בסיסית, אבל ללא תמיכה רשמית התוצאות יהיו לא עקביות ולא הייתי בונה עליו לפרויקט בעברית בלי בדיקה מקדימה.

האם כרטיס מסך ביתי יספיק להרצה שלו?

המשקלים לבדם שוקלים מעל 21 גיגה בייט. כרטיס עם 24 גיגה בייט יצליח לטעון אותו, אבל ניתוח וידאו כבד ימלא את הזיכרון מהר מאוד ויחייב חומרה מקצועית יותר.

איך מריצים

המשקלים תופסים 21.1 גיגה בייט ומחולקים ל־26 קבצים, כך שצריך כרטיס מסך מודרני עם לפחות 24 גיגה בייט זיכרון כדי לטעון אותו ישירות דרך ספריית transformers בסביבת פייתון 3.12. אם אתם מתכננים לנצל חלק משמעותי מחלון ההקשר הגדול שלו עם סרטונים ארוכים, תצטרכו כרטיס חזק בהרבה או מערך של כמה כרטיסים מקבילים כדי לא לחנוק את הזיכרון.

אם אין לכם שרת ייעודי זמין ברמה הזו והשימוש שלכם הוא בעיקר תמונות בודדות ולא סרטים שלמים, עדיף להשתמש ב־API חיצוני של מודל ראייה כללי במקום להתעסק עם אחסון וקירור מקומיים.

from transformers import pipeline

pipe = pipeline("video-text-to-text", model="OpenMOSS-Team/MOSS-VL-Instruct-0408")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית ומציינים את השינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗