GPT
V

vjepa2-vitg-fpc64-384

קוד פתוח

facebookapache-2.02025-03-27

  • transformers
  • safetensors
  • vjepa2
  • feature-extraction
  • video

מודל ראייה מבוסס וידאו של מטא שמייצר ייצוגים עמוקים לסרטונים ותמונות. הוא מתאים למי שבונה סיווג וידאו או צריך רכיב ראייה חזק למודל רב-מודאלי.

  • 1Bפרמטרים
  • 19.2 GBמשקל הקבצים
  • 4,054הורדות בחודש
  • 45לייקים

מה זה

מטא שחררה כאן מודל שמבוסס על ארכיטקטורת Joint Embedding Predictive Architecture של יאן לקון, עם מיליארד פרמטרים וארבעים שכבות. הרעיון הוא ללמוד הבנה של העולם החזותי מתוך וידאו בלי להסתמך על טקסט מתלווה, אלא על חיזוי של אזורים וזמנים מוסתרים בתוך הווידאו עצמו.

המשקל הזה מיועד לעבד 64 פריימים ברזולוציה של 384 על 384 פיקסלים. הוא לא פולט טקסט ולא עונה לשאלות בצ׳אט. התפקיד שלו הוא לקחת קלט וידאו או תמונה, ולהוציא וקטורים שמייצגים את התוכן החזותי והתנועה, כך שתוכלו להשתמש בהם לאחזור מידע, סיווג, או כבסיס למודלים מורכבים יותר.

מתאים ל

  • סיווג וידאו

    חילוץ וקטורים מ־64 פריימים של סרטון כדי לסווג פעולות ותנועות באמצעות מאמן קל משקל מעל המודל.

  • אינקודר ראייה למודל שפה

    חיבור המודל כרכיב ויזואלי במערכות VLM כדי להעניק למודל שפה יכולת הבנה של תנועה וסרטונים.

  • מנוע אחזור וחיפוש וידאו

    המרת מאגרי וידאו גדולים למרחב וקטורי שמאפשר מציאת קטעים דומים לפי תוכן חזותי.

איפה זה נופל

הקוד דורש התקנה של ספריית transformers ישירות מגיטהאב ולא מגרסה יציבה רגילה, מה שיכול לשבור סביבות עבודה קיימות. בנוסף, חובה לדגום בדיוק 64 פריימים עבור וידאו כדי שהקלט יתאים למודל, ואם תרצו להזין תמונת סטילס תצטרכו לשכפל אותה ידנית 16 פעמים כמו שמודגם בקוד. המודל רק מייצר וקטורים, כך שאי אפשר להשתמש בו לחיפוש טקסטואלי או זיהוי בלי לאמן שכבה נוספת מעליו.

שאלות
נפוצות

האם המודל יודע לענות על שאלות לגבי מה שקורה בווידאו?

לא. המודל הוא אנקודר בלבד שמייצר ייצוגים מתמטיים של התמונה והווידאו. כדי לקבל תשובות טקסטואליות, צריך לחבר אותו למודל שפה שמסוגל לפענח את הווקטורים האלה.

אפשר להזין לו סרטון בכל אורך ורזולוציה?

המודל מוגדר לעבוד עם 64 פריימים ברזולוציה מותאמת. עליכם לדגום את הפריימים הרלוונטיים מתוך הקובץ לפני השליחה, כך שסרטונים ארוכים ידרשו דגימה מרווחת או חלוקה למקטעים.

איך מריצים

המודל שוקל 19.2 גיגה-בייט ונשמר בדיוק של float32, כך שרק לטעינת המשקולות לזיכרון תצטרכו כרטיס מסך עם לפחות 24 גיגה-בייט זיכרון, כמו RTX 3090, RTX 4090 או כרטיסי שרת. כיוון שמעבדים 64 פריימים בבת אחת, תפיסת הזיכרון בזמן ריצה תקפוץ מהר אם לא תמירו את המודל לדיוק נמוך יותר כמו bfloat16 או float16.

ההרצה מתבצעת דרך ספריית transformers של Hugging Face יחד עם torchcodec לחיתוך הפריימים. אם אין לכם שרת ייעודי עם מעבד גרפי חזק, להריץ את הדגם הזה עצמאית עבור משימות קצרות יהיה יקר ומסורבל לעומת שירותי ענן.

from transformers import pipeline

pipe = pipeline("video-classification", model="facebook/vjepa2-vitg-fpc64-384")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 19.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש בלי תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗