GPT
V

VideoMamba

רץ בדפדפן

OpenGVLabapache-2.02024-03-15

  • gradio

מעלים סרטון או תמונה ומקבלים סיווג של הפעולה או האובייקט המוצגים בהם. הכלי מתאים לחוקרים ולמפתחים שרוצים לבחון את ארכיטקטורת Mamba בעיבוד וידאו.

  • הורדות בחודש
  • 97לייקים

מה זה

הממשק מחולק לשתי לשוניות נפרדות, אחת לווידאו ואחת לתמונות סטילס. בווידאו מעלים קובץ ומקבלים את חמש הקטגוריות המובילות מתוך מאגר Kinetics-400, כמו חבטת בייסבול, יוגה או רכיבה על הוברבורד, עם ציון הסתברות לכל קטגוריה. בלשונית התמונות מעלים קובץ ומקבלים סיווג מחמש מחלקות מובילות ממאגר ImageNet-1K, כגון חתול, כלב או פנדה.

מאחורי הקלעים רצים שני מודלים קטנים מסוג tiny ברזולוציה של 224 על 224 פיקסלים. מודל הווידאו דוגם 16 פריימים מתוך הקובץ באמצעות ספריית decord, ומודל התמונה מעבד תמונת PIL רגילה. הטכניקה מבוססת על מודל המצבים Mamba שהותאם לוויז'ואל, חלופה לטרנספורמרים שמטרתה לייעל את הניתוח הרציף של פריימים.

מתאים ל

  • סיווג פעולות בווידאו קצר

    זיהוי אוטומטי של פעילות ספורטיבית או תנועה מתוך קובץ וידאו לפי קטגוריות Kinetics-400.

  • זיהוי עצמים בתמונות

    קבלת חמש התוויות הסבירות ביותר מתוך ImageNet עבור תמונת סטילס בודדת.

  • בדיקת ארכיטקטורת Mamba

    השוואת ביצועי מודל מבוסס state space מול מודלי ראייה מבוססי טרנספורמר.

איפה זה נופל

המודלים בממשק הם גרסאות tiny בלבד ברזולוציית 224 על 224, כך שפרטים קטנים או איכות גבוהה הולכים לאיבוד בעיבוד. התוצאה היא תווית סיווג בלבד מתוך רשימות סגורות של 400 פעולות או 1,000 עצמים, בלי תיאור טקסט חופשי, זיהוי מקומי של אובייקטים או מעקב בזמן. בנוסף, שגיאת התצורה הנוכחית משביתה את הממשק לחלוטין.

שאלות
נפוצות

האם השימוש בעמוד כרוך בתשלום?

לא, הממשק פתוח לגישה חופשית ואינו דורש תשלום או מנוי. עם זאת, הוא רץ על תשתית שיתופית ולכן תלוי בזמינות השרתים. כרגע הוא נמצא במצב תקלה שמונע הרצה.

מה קורה לסרטונים ולתמונות שמעלים לשם?

הקבצים נשלחים ישירות לשרת שמריץ את מופע ה־Gradio לצורך ביצוע הניתוח. המפרסמים לא פירטו מדיניות שמירה עצמאית, כך שהתוכן כפוף למדיניות הפרטיות של פלטפורמת Hugging Face.

האם אפשר להוריד את המודל ולהריץ אותו במחשב מקומי?

כן, הקוד והמשקולות זמינים להורדה תחת רישיון apache-2.0. בקוד המקור רואים שהמשקולות נמשכות ישירות מהמאגר של OpenGVLab, כך שניתן לטעון אותן מקומית באמצעות PyTorch.

במה הממשק הזה שונה מהמודל המלא של VideoMamba?

הממשק מריץ רק את הגרסאות המוקטנות מסוג tiny שהוגדרו לעבוד על רזולוציית 224 פיקסלים ו־16 פריימים. המודלים המלאים של הפרויקט כוללים גדלים נרחבים יותר ויכולות שלא נחשפו בדף הזה.

איך משתמשים

בוחרים בלשונית הרצויה, מעלים קובץ מהמחשב או מקליקים על אחת הדוגמאות המוכנות, ולוחצים על Submit. הדוגמאות המובנות נשמרו מראש במטמון ולכן מוצגות מיד, אבל עיבוד קובץ חדש אמור לרוץ על מאיץ מסוג zero-a10g. נכון לעכשיו העמוד מסומן במצב CONFIG_ERROR, כך שאי אפשר להריץ אותו ישירות בדפדפן בלי תיקון ההגדרה בשרת.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה של הקוד והמשקולות. הקבצים שאתם מעלים מועברים לעיבוד בתשתית הענן של Hugging Face, ואין בתיעוד פירוט מעבר לתנאי השימוש הרגילים שם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗