GPT
V

vjepa2-vitl-fpc64-256

קוד פתוח

facebookmit2025-05-31

  • transformers
  • safetensors
  • vjepa2
  • feature-extraction
  • video

זהו מודל ייצוג וידאו שמפיק וקטורים עשירים מתוך 64 פריימים. הוא מתאים למי שבונה חיפוש וידאו, סיווג או מחבר מקודד חזותי למודל שפה.

  • 326Mפרמטרים
  • 6.0 GBמשקל הקבצים
  • 259,340הורדות בחודש
  • 206לייקים

מה זה

מטא שחררה כאן מודל שמבוסס על ארכיטקטורת Joint Embedding Predictive Architecture של יאן לקון, עם 326 מיליון פרמטרים על פני 24 שכבות. במקום לנסות לשחזר פיקסלים חסרים כמו מודלים גנרטיביים ישנים, הוא לומד לחזות ייצוגים מופשטים ישירות במרחב הוקטורי. התוצאה היא תיאור מרוכז ומדויק של התוכן והתנועה בתוך הסרטון, בלי לבזבז כוח חישוב על פרטים שאינם רלוונטיים להבנה.

המשקל שלו הוא 6.0 ג'יגה בייט בגלל שמירה בדיוק מלא של float32, והוא מיועד לעבד קטעים ברזולוציה של 256 על 256 על בסיס דגימה של 64 פריימים. מעבר לווידאו, הכרטיס מראה שאפשר להזין לו גם תמונות סטילס על ידי שכפול הפריים 16 פעמים, מה שמאפשר להשתמש באותו אנקודר בדיוק גם למשימות תמונה וגם למשימות וידאו.

מתאים ל

  • חיפוש וידאו סמנטי

    חילוץ וקטורים מסרטונים והשוואת דמיון במאגר נתונים לפי תוכן ותנועה.

  • אנקודר למודלי שפה

    חיבור המודל כמקודד ראייה כדי לאפשר למודלי שפה גדולים להבין קטעי וידאו.

  • סיווג פעולות בווידאו

    בניית מסווג קל משקל מעל הווקטורים לזיהוי התנהגויות ומחוות ב־64 פריימים.

איפה זה נופל

המודל הזה אינו מחזיר טקסט ולא עונה על שאלות. הוא מייצר וקטורים בלבד, כך שכדי לקבל סיווג ממשי או זיהוי פעולות תצטרכו לאמן מעליו שכבה נוספת או לחבר אותו למודל שפה. בנוסף, חלון הקלט מוגבל ל־64 פריימים ברזולוציה של 256 פיקסלים, כך שפעולות עדינות או סרטונים ארוכים במיוחד ידרשו מכם לתכנן אסטרטגיית דגימה מורכבת מראש.

שאלות
נפוצות

האם המודל יודע להחזיר תיאור טקסטואלי של הווידאו?

לא. מדובר במודל ראייה שמחזיר רק וקטורים של תכונות, ולא מודל שמייצר טקסט. כדי לקבל תיאור מילולי תצטרכו להשתמש בווידאו אנקודר הזה בתוך מודל רב תחומי שמחובר למודל שפה.

איך מזינים לו תמונה בודדת במקום סרטון שלם?

לפי ההנחיות בכרטיס המודל, טוענים את התמונה בעזרת המעבד ומשכפלים את ערכי הפיקסלים 16 פעמים בציר הזמן לפני ההזנה לרשת.

איך מריצים

טעינת המודל נעשית ישירות דרך ספריית transformers של פייתון, יחד עם torchcodec לפענוח יעיל של קובצי הווידאו. מאחר שהמשקלים מגיעים בפורמט float32 ושוקלים 6.0 ג'יגה, כרטיס מסך ביתי מודרני עם 8 עד 12 ג'יגה זיכרון יחזיק אותו בלי בעיה לצורך הסקת מסקנות וחילוץ וקטורים.

אם אתם מתכוונים לעבד סרטונים ארוכים בזמן אמת, צוואר הבקבוק יהיה חיתוך הפריימים והזיכרון של כרטיס המסך. במקרה של עומסים גדולים או היעדר תשתית GPU זמינה, משתלם יותר להרים שרת ייעודי או להסתמך על תשתית ענן שמריצה קונטיינר מוכן במקום להחזיק חומרה מקומית.

from transformers import pipeline

pipe = pipeline("video-classification", model="facebook/vjepa2-vitl-fpc64-256")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 6.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי הקוד, הפצה ושילוב במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗