GPT
V

vjepa2-vitg-fpc64-256

קוד פתוח

facebookapache-2.02025-04-07

  • transformers
  • safetensors
  • vjepa2
  • feature-extraction
  • video

מודל ראייה מבוסס ארכיטקטורת JEPA שמפיק ייצוגים מתמטיים מקטעי וידאו ותמונות. הוא מיועד למי שצריך אנקודר כבד לסיווג וידאו או לאיחזור מידע ויזואלי.

  • 1Bפרמטרים
  • 19.2 GBמשקל הקבצים
  • 161,597הורדות בחודש
  • 57לייקים

מה זה

מדובר באנקודר של מטא שנשען על ארכיטקטורת Joint Embedding Predictive Architecture ולא על טרנספורמר ראייה רגיל שמשחזר פיקסלים. הרעיון כאן הוא למידה של ייצוגים מופשטים ישירות מווידאו, בלי צורך בטקסט צמוד או בלייבלים מוכנים. המודל מחזיק כמיליארד פרמטרים ב־40 שכבות, והוא נבנה כדי לבלוע רצפים של 64 פריימים ברזולוציה בסיסית של 256 פיקסלים.

התוצר של הרצת המודל הוא לא טקסט וגם לא סיווג סופי מוכן, אלא וקטור תכונות עשיר. הוא פועל כמנוע הבנה בסיסי שאפשר להלביש עליו ראש סיווג, לחבר אותו למודל שפה רב־מודלי, או להשתמש בו לחיפוש קטעי וידאו דומים במאגר. אם אתם רגילים למודלי CLIP, ההבדל הוא שכאן הווידאו הוא אזרח סוג א׳ ולא אוסף תמונות מבודדות.

מתאים ל

  • חילוץ וקטורים לווידאו

    יצירת ייצוג נומרי לקטעי וידאו באורך 64 פריימים לצורך חיפוש דמיון במאגרים גדולים.

  • אנקודר למודלי VLM

    חיבור המודל כשכבת ראייה קדמית שמזינה מודל שפה במידע עשיר על תנועה והתרחשויות.

  • אימון מסווג ייעודי

    הלבשת שכבת סיווג דקה מעל הפיצ'רים כדי לזהות פעולות ספציפיות בסרטונים.

איפה זה נופל

המודל מפיק רק וקטורים, כלומר שום דבר לא עובד ישר מהקופסה בלי שכבת קוד נוספת שממירה את הווקטור לסיווג או לחיפוש. בנוסף, הכרטיס דורש דגימה מפורשת של 64 פריימים לווידאו, וכדי לעבד תמונה בודדת צריך לשכפל אותה 16 פעמים באופן מלאכותי כדי שהממדים יתאימו, מה שמעמיס חישובים מיותרים על משימות סטטיות.

שאלות
נפוצות

האם המודל יודע לענות על שאלות לגבי סרטון?

לא. המודל מחזיר רק וקטור של תכונות ויזואליות, ואין לו שכבת שפה או יכולת לפלוט טקסט. כדי לקבל תשובות תצטרכו לחבר אותו כרכיב קלט בתוך מערכת VLM גדולה יותר.

אפשר להריץ אותו על לפטופ רגיל?

לא באופן מעשי. קבצי המודל שוקלים מעל 19 גיגה־בייט בדיוק float32, כך שמעבד רגיל או כרטיס מסך ביתי ייחנקו מיד בניסיון לטעון אותו ולעבד 64 פריימים.

איך מריצים

כדי להריץ אותו צריך להתקין את transformers ישירות מגיטהאב ולהשתמש בספריית torchcodec לקריאת הפריימים. הקבצים שוקלים 19.2 גיגה־בייט בדיוק float32 מלא, מה שאומר שבלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון כדי להחזיק את המודל עצמו ולעבד רצף של 64 פריימים בלי לקרוס.

אם יש לכם שרת ייעודי בענן עם A10G או A100 תוכלו להריץ אותו עצמאית בלי בעיה. מנגד, אם המטרה היא רק תיוג מהיר לכמה עשרות קבצים ולא תשתית קבועה, החזקה של שרת כזה תעלה לא מעט ביחס לתועלת, ואין פה כרגע נקודת קצה מנוהלת של API מהקופסה.

from transformers import pipeline

pipe = pipeline("video-classification", model="facebook/vjepa2-vitg-fpc64-256")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 19.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה של המודל כחלק ממוצר סגור או פתוח. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, בלי חובת פתיחת קוד המקור שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗