GPT
V

videoprism-base-f16r288

קוד פתוח

googleapache-2.02025-06-14

  • videoprism
  • video-classification
  • video-embedding

אנקודר וידאו קומפקטי של גוגל שממיר קטעי תנועה לוקטורים בלי שתצטרכו לאמן מודל כבד מאפס. הוא מתאים למי שבונה סיווג או אחזור וידאו ומחפש משהו קל להרצה מקומית.

  • 436 MBמשקל הקבצים
  • 2,506הורדות בחודש
  • 108לייקים

מה זה

גוגל שחררו כאן אנקודר וידאו טהור שמבוסס על ארכיטקטורת ViViT עם שלד ViT-B וארבע שכבות temporal-attention, מאומן מראש על בסיס CoCa. הוא מקבל קטעי וידאו בגודל 288 על 288 פיקסלים עם 16 פריימים, ומוציא ייצוג וקטורי דחוס. הרעיון המרכזי פה הוא לחבר את הפלט שלו לשכבת סיווג קלה או למודל שפה, בלי לגעת במשקולות המקוריות.

בבנצ'מרק של Kinetics 400 כשהמודל קפוא לגמרי, גרסת הבסיס הזו מגיעה לתוצאה של 82.9, מעל דגמי SOTA קודמים בגודל דומה שנעצרו סביב 77.1. עם זאת, הדגם הציבורי הזה חלש במעט מהתוצאות שהוצגו במאמר המקורי בגלל אילוצי מדיניות על מאגרי האימון של החברה.

מתאים ל

  • סיווג פעולות בווידאו קצר

    חיבור שכבת סיווג דקה מעל הוקטורים לזיהוי פעולות אנושיות בסרטוני רשת קצרים.

  • איתור מרחבי של אובייקטים

    שילוב המודל יחד עם מנגנון bounding box לצורך מעקב ומיקום תנועה לאורך ציר הזמן.

  • הזנת וקטורים למודל שפה

    חילוץ מאפייני תמונה ותנועה מקבצי וידאו כקלט מוכן מראש למערכות מולטימדיה גדולות.

איפה זה נופל

הבעיה הבולטת ביותר היא שהוא לא מבין וידאו ארוך. המודל אומן על קטעים קצרים של 16 פריימים בלבד, וגם אם אפשר לבצע אינטרפולציה למיקומים בזמן, דפי המודל מציינים בפירוש שנדרש עוד מחקר כדי להתמודד עם סרטונים ארוכים, מידע גאומטרי ורמזים שאינם סמנטיים. בנוסף, האימון התבסס בחלקו על תמלולים אוטומטיים רועשים מיוטיוב, כך שהייצוגים שלו עלולים להיות מוטים או לא מדויקים בסרטונים מורכבים.

שאלות
נפוצות

האם המודל תומך בסרטונים עם יותר מ־16 פריימים?

כן, המודל מסוגל לקבל מספר פריימים משתנה באמצעות אינטרפולציה של ה־temporal positional embeddings. יחד עם זאת, הוא אומן במקור על 16 פריימים ברזולוציית 288x288, ולכן סרטונים ארוכים מדי עלולים לסבול מאיבוד הקשר והבנה מוגבלת של התוכן.

האם אפשר לחפש בווידאו באמצעות שאילתת טקסט חופשי?

לא עם הצ'קפוינט הספציפי הזה. מודל Base הרגיל כולל רק אנקודר ויזואלי ומחזיר וקטורים של תמונה ותנועה, כך שאם אתם צריכים התאמת טקסט לווידאו, עליכם להוריד את גרסת LvT שכוללת גם מודל טקסט של SentencePiece.

איך מריצים

המודל שוקל 436 מגה-בייט בלבד עם 114 מיליון פרמטרים, מה שאומר שהוא ירוץ בלי שום בעיה על כל כרטיס מסך ביתי מודרני, ואפילו על מעבד רגיל אם אין לכם עומס כבד בזמן אמת. הקוד עצמו מפותח ב־JAX ו־Flax ודורש שימוש בספריית videoprism מהמאגר הרשמי של גוגל דיפמיינד.

אם אתם צריכים חיפוש טקסט מול וידאו, הגרסה הזו לבדה לא תעזור לכם כי אין לה אנקודר טקסטואלי, ובשביל זה תצטרכו את גרסת ה־LvT המקבילה. אין כאן שירות ענן ייעודי של גוגל שמוכר קריאות לפי דקה, אז ההרצה כולה אצלכם בתשתית.

pip install -U huggingface_hub
hf download google/videoprism-base-f16r288

הקבצים

3 קבצים במאגר, 436 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצרים. אתם יכולים לשלב אותו באפליקציות סגורות בלי לפתוח את הקוד שלכם, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗