GPT
V

videomae-large

קוד פתוח

MCG-NJUcc-by-nc-4.02022-08-02

  • transformers
  • pytorch
  • safetensors
  • videomae
  • pretraining

בסיס חזק לעיבוד וידאו שמיועד להשלמת פריימים מוסתרים ולמידת ייצוגים. הוא מעניין את מי שצריך לאמן מסווג וידאו משלו על בסיס משקלים שעברו אימון מקדים מסיבי.

  • 343Mפרמטרים
  • 2.6 GBמשקל הקבצים
  • 3,922הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל שמיישם את רעיון ה־Masked Autoencoders על קטעי וידאו, בגרסת ה־Large שמכילה 24 שכבות וכ־343 מיליון פרמטרים. המודל חותך את הווידאו למקטעים קבועים של 16 על 16 פיקסלים, מסתיר חלקים מהם ומנסה לשחזר את הפיקסלים החסרים דרך מפענח ייעודי. האימון המקדים נעשה על מאגר Kinetics-400 לאורך 1600 תקופות אימון, בלי תיוג אנושי ישיר.

בניגוד למודלים שמסווגים וידאו ישר מהקופסה, הגרסה הזו שוחררה כמשקלי אימון מקדים בלבד. הייעוד העיקרי שלה הוא לשמש כבסיס לחילוץ מאפיינים, כששמים שכבה לינארית מעל טוקן ה־CLS כדי להתאים אותה למשימות סיווג ספציפיות בעזרת דאטה מתויג שלכם.

מתאים ל

  • אימון מסווג וידאו מותאם

    בסיס מעולה לכוונון עדין על דאטה-סט ייעודי בעזרת שכבה לינארית מעל טוקן ה־CLS.

  • חילוץ וקטורים מייצגים

    יצירת ייצוג מספרי לווידאו של 16 פריימים לטובת מנועי חיפוש דמיון או ניתוח פנימי.

  • מחקר על שחזור וידאו

    בדיקת התנהגות של ארכיטקטורת ViT בשחזור פיקסלים מוסתרים ברצפי תנועה.

איפה זה נופל

המשקלים האלה לא מזהים פעולות באופן עצמאי. אם תריצו עליהם סרטון תקבלו בעיקר חיזוי פיקסלים למקטעים מוסתרים, כך שחובה להוסיף שכבת סיווג ולאמן אותה כדי לקבל תועלת אמיתית. בנוסף, כרטיס המודל לא כולל תוצאות מדידה או מדדי דיוק, ונכתב על ידי צוות Hugging Face ולא על ידי החוקרים המקוריים, מה שמשאיר פערי מידע על נתוני האימון המדויקים.

שאלות
נפוצות

האם המודל מוכן לזהות פעולות בווידאו מיד לאחר ההורדה?

לא. מדובר בגרסת אימון מקדים בלבד שמנחשת פיקסלים חסרים, ולא במסווג מוכן. כדי לזהות אובייקטים או פעולות צריך להוסיף שכבה ייעודית ולאמן אותה על נתונים מתויגים.

האם אפשר להשתמש במודל הזה בתוך מוצר מסחרי?

לא, הרישיון הוא לשימוש לא מסחרי בלבד. כל שילוב שלו במערכת עסקית או במוצר בתשלום מפר את תנאי השימוש.

איך מריצים

טוענים את המודל דרך ספריית transformers בפייתון יחד עם מעבד התמונה VideoMAEImageProcessor. קלט ברירת המחדל מבוסס על 16 פריימים ברזולוציה של 224 על 224, ומעבירים אליו את הפיקסלים לצד מסכת בוליאנית של המקטעים המוסתרים.

הקבצים שוקלים 2.6 גיגה-בייט ונשמרים ב־float32, כך ש־343 מיליון פרמטרים דורשים כרטיס מסך מודרני עם מספיק זיכרון VRAM כדי להריץ אימון המשך על רצפי תמונות כבדים. אם אתם רק צריכים סיווג מוכן ולא מאמנים מודל משלכם, עדיף לחפש גרסה שכבר עברה התאמה למשימה הספציפית.

from transformers import pipeline

pipe = pipeline("video-classification", model="MCG-NJU/videomae-large")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 2.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0, שמשמעותו איסור מוחלט על שימוש מסחרי. מותר להשתמש בו למחקר, בדיקות פנימיות ולמידה, תוך מתן קרדיט ליוצרים. אם המטרה היא להטמיע יכולות סיווג וידאו במוצר שמייצר הכנסה, המודל הזה פסול לשימוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗