GPT
V

videomae-base-finetuned-kinetics

קוד פתוח

MCG-NJUcc-by-nc-4.02022-07-08

  • transformers
  • pytorch
  • safetensors
  • videomae
  • video-classification

מודל ראייה ממוחשבת לסיווג קטעי וידאו לפי 400 פעולות אנושיות מוכרות. הוא מתאים למי שצריך תיוג פעולות מוכן מהקופסה בלי להשקיע משאבי אימון כבדים.

  • 87Mפרמטרים
  • 660 MBמשקל הקבצים
  • 135,368הורדות בחודש
  • 52לייקים

מה זה

מדובר בהרחבה של Vision Transformer לווידאו, שמאומנת בשיטה של שחזור חלקים מוסתרים בפריימים לפני שלב ההתאמה הסופית. הארכיטקטורה מפרקת את הפריימים לטלאים של 16 על 16 פיקסלים ודוחפת אותם לתוך 12 שכבות טרנספורמר, כך שהיא תופסת גם תנועה בזמן ולא רק תמונה בודדת.

המשקולות הנוכחיות עברו התאמה על Kinetics-400, ומספקות דיוק Top-1 של 80.9 אחוז ו־Top-5 של 94.7 אחוז במבחן הבדיקה של המאגר. המשמעות בפועל היא שכמעט בכל סרטון, התיוג הנכון יופיע בין חמש האפשרויות הראשונות שהמודל פולט, בתנאי שהפעולה שייכת לרשימת המחלקות המקורית.

מתאים ל

  • תיוג סרטונים קצרים

    זיהוי מהיר של פעולות ספורט או תנועות אנושיות בקטעי וידאו שמחולקים מראש לכמה שניות.

  • חילוץ מאפיינים לאימון

    שימוש בשכבות המודל כבסיס לחילוץ וקטורים שמייצגים תנועה, לצורך אימון מסווג חדש משלכם.

  • סינון תוכן במחקר

    קטלוג אוטומטי של מאגרי וידאו גדולים למטרות מחקר אקדמי לפי 400 פעולות מוגדרות.

איפה זה נופל

המגבלה המרכזית היא התלות המוחלטת ב־400 המחלקות של Kinetics-400. אם הווידאו שלכם מכיל פעולה שלא קיימת ברשימה, המודל פשוט ינחש את המחלקה הכי קרובה בצורה שגויה. בנוסף, הוא מצפה לקלט קצרצר של 16 פריימים, כך שהוא לא מסוגל להבין הקשר ארוך בסרטים או תהליכים שנמשכים דקות ארוכות בלי שתפרקו את הווידאו לקטעים בעצמכם.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה באפליקציה בתשלום?

לא. הרישיון הוא לשימוש לא מסחרי בלבד, ולכן הטמעה שלו במוצר מסחרי מפרה את תנאי השימוש.

האם המודל יודע לנתח סרטון ארוך של שעה?

לא באופן ישיר. המודל בנוי לקבל קטע קצר של 16 פריימים, כך שתצטרכו לחתוך את הסרטון לחתיכות קטנות ולהריץ עליהן את המודל בנפרד.

איך מריצים

עם 87 מיליון פרמטרים ומשקל קבצים של 660 מגה בייט, המודל הזה קל מאוד לטעינה ומסתדר בקלות על כל כרטיס מסך ביתי עם 4 עד 6 גיגה זיכרון. טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון, ומעבירים אליו רצף של 16 פריימים ברזולוציה מתאימה.

אם יש לכם צורך לעבד סרטונים בודדים פעם ביום, אפשר לזרוק את זה על מעבד רגיל או להשתמש בשירות מרוחק. לעומת זאת, אם אתם מנתחים זרם קבוע של סרטונים, הרצה מקומית על שרת ייעודי תהיה הרבה יותר זולה ופשוטה מאשר לשלם לפי קריאה למודלים חיצוניים.

from transformers import pipeline

pipe = pipeline("video-classification", model="MCG-NJU/videomae-base-finetuned-kinetics")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 660 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה וחד משמעית, מותר להשתמש במודל, לשנות אותו ולחקור אותו לצרכים אקדמיים או אישיים, אבל אסור לשלב אותו בכל מוצר או שירות שמייצר הכנסה מסחרית.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗