GPT
V

videomae-base

קוד פתוח

MCG-NJUcc-by-nc-4.02022-08-03

  • transformers
  • pytorch
  • safetensors
  • videomae
  • pretraining

בסיס לאימון מודלים שמבינים וידאו בלי צורך בתיוג מראש. מורידים אותו כדי לחלץ ייצוגים ויזואליים או לאמן מסווג על גבי שכבות מוכנות.

  • 94Mפרמטרים
  • 719 MBמשקל הקבצים
  • 435,945הורדות בחודש
  • 56לייקים

מה זה

מדובר בארכיטקטורת Vision Transformer שעברה התאמה לניתוח וידאו בגישת Masked Autoencoder. המודל אומן מראש בשיטה של למידה עצמית על מאגר Kinetics-400 לאורך 1600 אפוקים, כשהמטרה שלו הייתה לשחזר פיקסלים חסרים מתוך מקטעי וידאו שהוסתרו ממנו.

הווידאו מפורק לטלאים בגודל 16 על 16 פיקסלים שנשלחים לשכבות הטרנספורמר יחד עם טוקן סיווג ייעודי. במקום לזהות פעולות מהקופסה, המשקלים האלה למדו תנועה ומבנה של סרטונים, ומספקים ייצוג נומרי פנימי שאפשר להלביש עליו שכבה ליניארית למשימות סיווג ספציפיות.

בכרטיס המודל אין מדדי דיוק או תוצאות מבחן, מכיוון שהוא מוגדר כמודל קדם-אימון בלבד ולא כמסווג סופי.

מתאים ל

  • בסיס לאימון מסווג וידאו

    מלבישים שכבה ליניארית מעל טוקן הסיווג ומאמנים אותה על דאטה-סט מקומי מתויג.

  • חילוץ וקטורים מסרטונים

    משתמשים במצב הנסתר האחרון כמייצג של הסרטון כולו לצורכי חיפוש דמיון או השוואה.

  • מחקר על שחזור טלאי וידאו

    מריצים שחזור פיקסלים מתוך סרטונים מקוטעים לבדיקת התנהגות מודלי Masked Autoencoders.

איפה זה נופל

זה לא מוצר עובד שמחזיר תוויות כמו ריצה או בישול. מחוץ לקופסה הוא יודע רק לשחזר חלקים מוסתרים בפריימים, ולכן אם תריצו אותו בלי לאמן עליו שכבת סיווג משלכם, לא תקבלו שום פלט שימושי.

בנוסף, הכרטיס שלו ריק מנתוני ביצועים, מדדי שגיאה או תיעוד על אופן עיבוד הנתונים המדויק. מי שבוחר בו חייב לקחת בחשבון עבודת אימון נוספת ובדיקות עצמאיות לגמרי.

שאלות
נפוצות

האם אפשר להעלות סרטון ולקבל ישר זיהוי של הפעולה שמתרחשת בו?

לא. המשקלים האלה מכילים רק את שלב קדם-האימון לשחזור פריימים, בלי ראש סיווג סופי שמחזיר שמות של קטגוריות. כדי לזהות פעולות צריך לאמן עליו שכבה נוספת או לחפש גרסה שכבר עברה כוונון עדין במאגר.

אפשר להשתמש במודל הזה באפליקציה מסחרית בתשלום?

לא, הרישיון המדווח אוסר שימוש מסחרי מכל סוג. אם המטרה היא להכניס את היכולת למוצר שמניב הכנסות, תצטרכו לחפש מודל עם רישיון פתוח יותר או להגיע להסכם מול היוצרים.

איך מריצים

טוענים את המשקלים ישירות דרך ספריית transformers בפייתון עם מחלקת VideoMAEForPreTraining ומעבד התמונה התואם. קבצי המודל שוקלים בסך הכול 719 מגה-בייט וכוללים 94 מיליון פרמטרים, כך שאפשר להריץ אותו בקלות גם על מעבד גרפי ביתי פשוט ואפילו על מעבד מרכזי בלי להיחנק בזיכרון.

הקוד דורש קלט וידאו במבנה של 16 פריימים ברזולוציה של 224 על 224 פיקסלים. אין כאן שירות ענן או נקודת קצה מנוהלת, כך שהרצה מקומית היא הדרך היחידה לעבוד איתו.

from transformers import pipeline

pipe = pipeline("video-classification", model="MCG-NJU/videomae-base")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 719 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: מותר להשתמש בו למחקר, ניסויים ופיתוח פנימי, אבל אסור לחלוטין לשלב אותו במוצר מסחרי, למכור שירות סביבו או לייצר ממנו רווח כספי בלי לקבל אישור נפרד מבעלי הזכויות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗