GPT
L

LLaVA-NeXT-Video-7B-hf

קוד פתוח

llava-hfllama22024-06-05

  • transformers
  • safetensors
  • llava_next_video
  • image-text-to-text
  • video-text-to-text

מודל פתוח שמשלב הבנת וידאו ותמונות יחד עם טקסט. מתאים למי שרוצה לשאול שאלות ישירות על תוכן של סרטונים בלי לשלוח מדיה לשירותים חיצוניים.

  • 7.1Bפרמטרים
  • 4,096טוקנים בהקשר
  • 13.2 GBמשקל הקבצים
  • 66,292הורדות בחודש

מה זה

מדובר במודל שמבוסס על Vicuna בגרסת שבעה מיליארד פרמטרים, אשר אומן במקור על תערובת רחבה של תמונות והוראות, ולאחר מכן עבר כוונון נוסף עם כמאה אלף דוגמאות וידאו כדי לחבר בין פריימים לשפה טבעית.

הוא מסוגל לעבד קלט מעורב שכולל גם תמונות סטילס וגם קובצי וידאו בתוך אותה שיחה, כשהווידאו נדגם מראש בצורה אחידה לעד 32 פריימים. בבדיקות של יוצריו במבחן VideoMME הוא מציג תוצאות מובילות בקטגוריית הקוד הפתוח, מה שאומר שהוא מתמודד יפה עם שאלות הבנה על מה שקורה לאורך זמן בסרטון.

מתאים ל

  • מענה על שאלות מסרטונים

    מאפשר לשאול ישירות למה משהו קרה בסרטון או מה מופיע בפריים מסוים.

  • תיוג תוכן משולב מדיה

    מתאים לחילוץ תיאור טקסטואלי מקבצי וידאו ותמונות יחד באותו הפרומפט.

  • בדיקת וידאו מקומית

    טוב לפיתוח שדורש ניתוח ויזואלי על שרת מקומי בלי לחשוף מידע החוצה.

איפה זה נופל

חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, וכשמזינים וידאו שנדגם לפריימים רבים, ייצוג התמונה תופס חלק ניכר מהמקום הזה ומשאיר מעט מאוד מקום לשאלות מורכבות או היסטוריית שיחה. בנוסף, המודל אומן על אנגלית בלבד ולכן הבנה וייצור של עברית אינם נתמכים בצורה אמינה. חשוב גם לזכור שדגימה אחידה של 32 פריימים מפספסת בקלות פרטים קצרים ומהירים בסרטונים ארוכים.

שאלות
נפוצות

האם אפשר לתת לו סרטון של שעה ולשאול שאלות?

לא מומלץ. ברירת המחדל דוגמת 32 פריימים בלבד, ובסרטון ארוך מרווחי הזמן בין פריים לפריים יגרמו למודל לפספס את רוב ההתרחשויות. בנוסף, חלון ההקשר קצר מדי לניתוח מעמיק כזה.

האם המודל עובד טוב בעברית?

הוא אומן על נתונים באנגלית בלבד. פקודות בעברית עלולות להניב תשובות שגויות, תרגום עילג או התעלמות מוחלטת מההוראות.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם זיכרון ייעודי של לפחות 16 גיגה־בייט לעבודה בפורמט חצי דיוק, או להשתמש בכימות של 4 ביט דרך ספריית bitsandbytes כדי לדחוס אותו לכרטיסים צרכניים קטנים יותר. המודל נתמך ישירות בספריית transformers בגרסאות החדשות.

אם אין לכם כרטיס עם זיכרון מתאים או שאתם צריכים לנתח סרטונים ארוכים במקביל, כדאי לשקול שירות ענן או API חיצוני. עיבוד של עשרות פריימים במקביל דורש משאבי חישוב כבדים שמורגשים מיד בכל שאילתה.

from transformers import pipeline

pipe = pipeline("video-text-to-text", model="llava-hf/LLaVA-NeXT-Video-7B-hf")
print(pipe("שלום"))

הרישיון

המודל כפוף לרישיון הקהילתי של Llama 2 מבית מטא. הרישיון מאפשר שימוש מסחרי ומחקר, אך מטיל מגבלות אם המוצר שלכם מגיע ליותר מ־700 מיליון משתמשים פעילים בחודש, ואוסר על שימוש בפלטים שלו כדי לאמן מודלים מתחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗