GPT
V

VideoLLaMA3-7B

קוד פתוח

DAMO-NLP-SGapache-2.02025-01-21

  • transformers
  • safetensors
  • videollama3_qwen2
  • text-generation
  • multi-modal

מודל פתוח להבנת וידאו ותמונות שמבוסס על שילוב של Qwen2.5 עם מקודד חזותי ייעודי. הוא נותן מענה למי שרוצה לנתח קטעי וידאו מקומית בלי לשלוח מדיה לשירותים חיצוניים.

  • 8Bפרמטרים
  • 32,768טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 2,051הורדות בחודש

מה זה

מדובר במודל רב מודלי של 8 מיליארד פרמטרים שמיועד לקבל וידאו או תמונה יחד עם טקסט, ולהחזיר תשובות טקסטואליות. בבסיס שלו יושב מודל השפה Qwen2.5-7B, ואליו הוצמד מקודד ראייה מותאם מסוג siglip-so400m-patch14-384. השילוב הזה נבנה כדי להבין רצפים דינמיים של פריימים ולא רק תמונות בודדות.

המטרה כאן היא חילוץ תובנות, הסקת מסקנות מתוך סצנות בתנועה וחיבור בין פרטים שמופיעים לאורך זמן בציר הווידאו לבין שאלות מורכבות. חלון ההקשר עומד על 32,768 טוקנים, מה שמאפשר להזין כמות נכבדה של מידע חזותי וטקסטואלי באותה קריאה.

מתאים ל

  • תחקור וניתוח וידאו

    מענה על שאלות מורכבות לגבי אירועים, עצמים ופעולות שמתרחשים לאורך רצף של פריימים.

  • תיוג סרטונים אוטומטי

    חילוץ תיאורים מילוניים ותובנות מתוך תוכן חזותי לצורכי קטלוג וחיפוש פנימי בארגון.

  • הבנת תמונות סטטיות

    הסבר והסקה לוגית מתמונות ומסמכים חזותיים בזכות מקודד הראייה המשולב במודל.

איפה זה נופל

הכרטיס מצהיר על תמיכה בשפה האנגלית בלבד, כך שלא כדאי לבנות עליו להבנה או מענה בעברית. בנוסף, מודלים של וידאו סובלים לעיתים מהזיות לגבי סדר האירועים בציר הזמן, וצריך לבדוק בפועל אם הוא מזהה נכון פעולות רציפות ולא ממציא פרטים שלא קרו בסרטון.

שאלות
נפוצות

האם המודל תומך בעברית?

התיעוד הרשמי מציין תמיכה באנגלית בלבד. מודל הבסיס אמנם כולל יכולות מסוימות בשפות נוספות, אך לא מומלץ להסתמך עליו לעיבוד וידאו עם הנחיות בעברית ללא בדיקה קפדנית.

מה ההבדל בין הגרסה הזו לגרסת ה־Image?

הגרסה הזו אומנה ישירות על משימות וידאו ומבינה רצפי זמן ותנועה, בעוד גרסאות ה־Image מסדרה זו ממוקדות בעיבוד תמונות בודדות בלבד.

אפשר להשתמש בו במוצר מסחרי?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי מלא. אתם יכולים לשלב אותו במערכות פנימיות או במוצרים שאתם מוכרים ללקוחות, בכפוף לתנאי הרישיון.

איך מריצים

כדי להריץ אותו צריך להוריד כ־15 גיגה בייט של משקלים בפורמט bfloat16. משמעות הדבר היא שחובה כרטיס מסך עם זיכרון וידאו ייעודי שיכול להחזיק לפחות את המשקלים עצמם ועוד מקום לפריימים ולטוקנים של ההקשר, או לחלופין לבצע קוונטיזציה.

ההרצה מתבצעת דרך ספריית transformers הרגילה בפייתון. אם אין לכם חומרה מתאימה עם מספיק זיכרון גרפי, לא תוכלו להריץ אותו מקומית ותצטרכו לשכור שרת ענן ייעודי עם מאיץ גרפי חזק, או לבדוק את הדמו הקיים ברשת.

from transformers import pipeline

pipe = pipeline("video-text-to-text", model="DAMO-NLP-SG/VideoLLaMA3-7B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים מופצים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗