GPT
V

Video-LLaVA-7B-hf

קוד פתוח

LanguageBindרישיון לא דווח2024-05-09

  • transformers
  • safetensors
  • video_llava
  • image-text-to-text
  • endpoints_compatible

מודל שמבין גם תמונות וגם וידאו באותו מרחב בלי להפריד ביניהם. הוא מתאים למי שחייב לנתח פריימים ווידאו יחד בלי להחזיק שני מודלים נפרדים.

  • 7.4Bפרמטרים
  • 4,096טוקנים בהקשר
  • 13.7 GBמשקל הקבצים
  • 24,255הורדות בחודש

מה זה

מדובר במודל שפה ויזואלי שלוקח את הרעיון של LLaVA צעד קדימה. במקום להסתמך על מודל נפרד לתמונות ומודל נפרד לווידאו, הוא משתמש במקודד שמאחד את הייצוג הוויזואלי לפני שלב ההיטל לשפה. זה מאפשר לו לקבל קלט משולב של תמונות ווידאו יחד, אפילו שבנתוני האימון שלו לא היו צמדים ישירים של תמונה לצד וידאו.

בבסיס שלו יושב מודל שפה אוטו-רגרסיבי בארכיטקטורת טרנספורמר, והוא עבר כוונון ייעודי על דאטה-סטים של מעקב אחרי הוראות. האימון התבסס על נתוני תמונות מתוך LLaVA, יחד עם נתוני וידאו שנלקחו מ־Valley ומ־Video-ChatGPT. השילוב הזה נותן לו יתרון מובהק על פני מודלים שמנתחים רק מדיה מסוג אחד, כי הוא מסוגל להבין הקשר רציף שנע בין סטילס לתנועה.

מתאים ל

  • ניתוח משולב של תמונה ווידאו

    הבנת שאלות שמשוות בין תמונת סטילס בודדת לקטע וידאו קצר בתוך אותו הקשר.

  • תיוג פעולות בקטעי וידאו

    מעקב אחר הוראות וזיהוי של מה שמתרחש בתוך קליפים קצרים על בסיס טקסט חופשי.

  • מחקר אקדמי על מולטימדיה

    בדיקת ייצוג ויזואלי מאוחד של תנועה וסטילס בסביבת מחקר שאינה מסחרית.

איפה זה נופל

חלון ההקשר עומד על 4,096 טוקנים בלבד. בווידאו, שבו כל רצף פריימים מתורגם לכמות עצומה של טוקנים ויזואליים, החלון הזה נסתם מהר מאוד. זה אומר שלא תוכלו להזין סרטונים ארוכים במיוחד או לנהל שיחה מתמשכת ומפורטת סביב קטע וידאו בלי לחתוך אותו באגרסיביות.

בנוסף, הכרטיס מציין שהמודל אומן על מידע שנוצר בחלקו על ידי OpenAI ומשתמשי ShareGPT, לצד משקולות בסיס ממשפחת LLaMA. זה חושף את הפלטים להטיות מובנות של אותם מאגרים ומגביל את השימוש במערכות שדורשות אמינות מוחלטת.

אותה משפחה

Video-LLaVA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא. למרות שחלק מהקוד מוגדר תחת רישיון פתוח, המודל עצמו הוגדר לתצוגת מחקר בלבד ללא שימוש מסחרי. הוא מושפע ישירות מתנאי הרישוי של LLaMA ונתוני אימון שמקורם ב־OpenAI.

כמה וידאו אפשר להכניס לו בבת אחת?

מעט מאוד. חלון ההקשר מוגבל ל־4,096 טוקנים, ותמונות ווידאו תופסות נפח טוקנים גדול מאוד. המודל מיועד לקטעים קצרים או דגימת פריימים ספורים, ולא לסרטים או קבצים כבדים.

איך מריצים

כדי להריץ את 7.4 מיליארד הפרמטרים שלו בדיוק bfloat16 תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה-בייט של VRAM, בהתחשב במשקל הקבצים שמגיע לכמעט 14 גיגה-בייט ולצריכת הזיכרון של רצפי הווידאו. הוא נתמך ישירות בספריית transformers תחת הארכיטקטורה VideoLlavaForConditionalGeneration, מה שמפשט מאוד את האינטגרציה בקוד פייתון רגיל.

אם אין לכם חומרה מקומית חזקה או שאתם לא צריכים שליטה מלאה בנתונים ובמשקלים, הרצה עצמית של מודל וידאו כזה תהיה יקרה וכבדה מדי בהשוואה לקריאה לשירות מנוהל חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="LanguageBind/Video-LLaVA-7B-hf")
print(pipe("שלום"))

הרישיון

המצב המשפטי כאן בעייתי מאוד לחברות. בעמוד המודל לא מוגדר רישיון רשמי, אבל הטקסט מפנה לפרויקט שמבוסס בחלקו על Apache 2.0 ומגדיר את השירות כתצוגת מחקר לשימוש לא-מסחרי בלבד. המודל כפוף למגבלות של LLaMA, לתנאי השימוש של OpenAI ולמדיניות של ShareGPT, כך שאסור לשלב אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗