GPT
L

LLaVA-Video-7B-Qwen2

קוד פתוח

lmms-labapache-2.02024-09-02

  • transformers
  • safetensors
  • llava
  • text-generation
  • multimodal

מודל פתוח להבנת וידאו ותמונות שמחבר ראייה ממוחשבת לבסיס של Qwen2. אם אתם צריכים לתשאל קובצי וידאו מקומית בלי לשלוח פרימים החוצה, זו אחת האופציות החזקות בגודל שמונה מיליארד.

  • 8Bפרמטרים
  • 32,768טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 19,639הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמיועד ספציפית לעבודה עם וידאו, לצד יכולת לטפל בתמונה בודדת או ברצף תמונות. הארכיטקטורה משלבת מקודד ויזואלי מסוג SO400M עם מודל השפה Qwen2, ואומנה על שילוב של 1.6 מיליון דוגמאות ממאגרי LLaVA-Video-178K ו־LLaVA-OneVision. התוצאה היא כלי שמסוגל לקבל קלט ויזואלי יחד עם הנחיות טקסט באנגלית ובסינית, ולענות על שאלות לגבי המתרחש בצילום.

הייחוד כאן לעומת מודלי ראייה סטנדרטיים הוא היכולת לפרק וידאו לעד 64 פרימים ולנתח אותם לאורך ציר הזמן. חלון ההקשר עומד על 32,768 טוקנים, מה שמאפשר להזין את המידע הוויזואלי הכבד יחד עם פרומפטים מורכבים. הוא לא מתאים לעיבוד סרטים שלמים באורך מלא בגלל תקרת הפרימים, אבל לקטעים ממוקדים שדורשים הבנת רצף פעולות יש לו יתרון ברור על פני מודלים שמנתחים רק תמונות בודדות.

מתאים ל

  • תחקור מקטעי וידאו

    מענה על שאלות לגבי פעולות שמתרחשות בקליפ קצר, עד 64 פרימים, תוך מעקב אחרי רצף האירועים בציר הזמן.

  • חילוץ תובנות מרצף תמונות

    ניתוח כמה תמונות עוקבות מאותה סצנה כדי לזהות שינויים, תנועה או הבדלים בין מצבים שונים.

  • מענה לשאלות על תמונה יחידה

    שימוש ביכולות הראייה הממוחשבת של SO400M כדי לתאר בפירוט תמונה בודדת ולהשיב לפרומפטים מורכבים באנגלית.

איפה זה נופל

המגבלה הטכנית הקשיחה ביותר היא תמיכה בעד 64 פרימים בלבד. אם תנסו לנתח סרטון ארוך בלי לדגום אותו מראש, המודל פשוט יפספס אירועים שקרו בין הפרימים שנבחרו. בנוסף, האימון מיועד רשמית לאנגלית ולסינית בלבד, כך שאין כאן תמיכה בעברית או התאמה לפענוח טקסט עברי שמופיע בתוך הווידאו.

שאלות
נפוצות

אפשר להעלות אליו סרטון ארוך של שעה?

לא באופן ישיר. המודל מוגבל לעד 64 פרימים לסרטון, כך שתצטרכו לדגום ממנו מעט מאוד תמונות ביחס לזמן, או לחתוך את הסרטון לקטעים קצרים מאוד לפני הניתוח.

המודל מבין שאלות בעברית?

האימון נעשה עבור אנגלית וסינית בלבד. הוא לא הותאם לעברית, ולכן אם תפנו אליו בעברית תקבלו תוצאות משובשות או חוסר הבנה מוחלט, וכדאי לעבוד מולו באנגלית.

האם כרטיס מסך ביתי יספיק כדי להריץ אותו?

כן, בתנאי שיש בו מספיק זיכרון וידאו. הקבצים שוקלים 15 גיגה בייט בדיוק המקורי, ולכן כרטיס עם 24 גיגה בייט כמו RTX 3090 או RTX 4090 יוכל להריץ אותו, אך כרטיסים נפוצים של 8 או 12 גיגה בייט לא יספיקו בלי קוונטיזציה.

איך מריצים

המשקלים תופסים 15 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כדי לטעון אותו ולהריץ הסקת מסקנות בצורה נוחה. מאיץ כמו RTX 3090 או RTX 4090 יעשה את העבודה, או כרטיסי A100 ו־H100 בשרת.

הרצה מקומית מבוססת על ספריית transformers ודורשת את הקוד של LLaVA-NeXT. אם אין לכם חומרה ייעודית זמינה או שמדובר בפרויקט נקודתי שלא מצדיק תחזוקת שרת עם כרטיס חזק, שימוש בשירותי ענן לפי צריכה יהיה פשוט וזול יותר.

from transformers import pipeline

pipe = pipeline("video-text-to-text", model="lmms-lab/LLaVA-Video-7B-Qwen2")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקלים והפצה של המערכת בתוך מוצרים סגורים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗