GPT
V

vivit-b-16x2-kinetics400

קוד פתוח

googlemit2022-11-23

  • transformers
  • pytorch
  • vivit
  • vision
  • video-classification

מדובר במודל סיווג וידאו של גוגל שמבוסס על ארכיטקטורת שנאי ראייה. הוא שוקל מעט מאוד ומתאים למי שרוצה בסיס מוכן לסיווג פעולות בקטעי וידאו קצרים.

  • 339 MBמשקל הקבצים
  • 97,609הורדות בחודש
  • 41לייקים
  • 12שכבות

מה זה

המודל הזה לוקח את הרעיון של Vision Transformer ומותח אותו מתמונות בודדות לקטעי וידאו. במקום לנתח פריים בודד, הוא מעבד רצף תמונות לאורך זמן כדי להבין פעולות שלמות. המשקל שלו עומד על 339 מגה בייט בלבד, מה שהופך אותו לקל משמעותית ממודלים כבדים של וידאו שמבוססים על רשתות תלת ממדיות ישנות.

האימון שלו נעשה על Kinetics400, מאגר שכולל ארבע מאות קטגוריות של פעולות אנושיות יומיומיות, מספורט ועד בישול. הוא מגיע עם שתים עשרה שכבות בארכיטקטורת ViViT ייעודית, ומיועד לשמש נקודת פתיחה טובה לסיווג וידאו כללי לפני שמבצעים התאמות ספציפיות.

מתאים ל

  • סיווג פעולות אנושיות

    הוא אומן על Kinetics400 ומזהה מאות פעולות בסיסיות של בני אדם מתוך וידאו.

  • בסיס לאימון נוסף

    המשקל הקל של 339 מגה בייט הופך אותו לנקודת מוצא זולה להתאמה אישית של וידאו.

  • תיוג תוכן לסרטונים

    מתאים למיון אוטומטי של קטעים קצרים לפי הפעילות המרכזית שמתרחשת בהם.

איפה זה נופל

הכרטיס לא נכתב על ידי המפתחים המקוריים בגוגל אלא על ידי הצוות של Hugging Face, ולכן חסרים בו מדדי ביצועים מדויקים ופירוט על הנתונים. המודל אומן על פעולות מוגדרות מראש בלבד. הוא לא יבין אירועים מורכבים, לא מיועד למעקב אחרי אובייקטים, וכל וידאו ארוך ידרוש חיתוך ודגימה מראש כדי להתאים למבנה הקלט.

שאלות
נפוצות

האם אפשר להריץ אותו על סרטונים ארוכים?

לא באופן ישיר. המודל בנוי לקלוט רצף קצר וקבוע של פריימים, ולכן תצטרכו לחתוך את הסרטון למקטעים קצרים ולדגום אותם לפני שמזינים פנימה.

האם הוא מתאים לזיהוי חפצים בתוך הפריים?

לא, המשימה שלו היא סיווג וידאו כללי ולא איתור עצמים. הוא מחזיר תווית שמגדירה את הפעולה כולה ולא מיקומים של פריטים על המסך.

איך מריצים

המודל נתמך ישירות בספריית transformers הרגילה, ולכן הטעינה שלו לוקחת כמה שורות פשוטות של פייתון. בגלל שמדובר בקובץ של 339 מגה בייט בדיוק של float32, אפשר להריץ אותו בלי בעיה על כרטיס מסך בסיסי עם מעט זיכרון, ואפילו על מעבד רגיל אם לא מדובר בבקרת זמן אמת.

עיקר העומס כאן הוא לא המודל עצמו אלא עיבוד הווידאו מראש. פריסה של סרטונים לפריימים דורשת זיכרון ומשאבי עיבוד, ולכן אם אין לכם תשתית נוחה לקריאת קובצי וידאו, שירות מנוהל יכול לחסוך התעסקות טכנית.

from transformers import pipeline

pipe = pipeline("video-classification", model="google/vivit-b-16x2-kinetics400")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 339 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון כאן הוא MIT, מה שאומר שיש לכם חופש מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצר סגור ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗