GPT
I

InternVideo2_5_Chat_8B

קוד פתוח

OpenGVLabapache-2.02025-01-22

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • multimodal

זהו מודל שמנתח וידאו ארוך ומשיב עליו בטקסט. הוא מתאים למי שרוצה לעבד ציר זמן מורכב מקומית בלי לשלוח סרטונים שלמים לענן.

  • 8.4Bפרמטרים
  • 15.6 GBמשקל הקבצים
  • 2,893הורדות בחודש
  • 92לייקים

מה זה

מדובר במודל שפה רב-מודאלי מבוסס InternVL2.5 שנועד להבין וידאו. הוא מתמקד בשני דברים שקשים למודלים כאלה, קליטה של פרטים קטנים בפריים ומעקב אחרי מה שקורה לאורך זמן. החוקרים עשו את זה באמצעות דחיסת ייצוגי מרחב-זמן כדי להכניס יותר תוכן בלי לחנוק את הזיכרון, ואימון ייעודי למשימות וידאו צפופות.

במבחני הביצועים הוא מקבל 75.7 ב־MVBench שבודק הבנת וידאו כללית, 60.6 ב־LongVideoBench לסרטונים ארוכים, ו־65.1 ב־VideoMME בלי כתוביות. המשמעות היא שהוא מצליח לעקוב אחרי רצף אירועים ולחלץ תשובות מתוך וידאו גולמי סביר למדי לגודל שלו, אבל עדיין יש נפילה ברורה כשהסרטון נהיה ארוך ומסובך יותר.

מתאים ל

  • תחקור סרטוני אבטחה

    זיהוי אירועים ופעולות על פני ציר זמן ממושך מתוך קבצי וידאו מקומיים.

  • תיוג תוכן וידאו

    חילוץ תיאורים מילוניים מתוך קטעי וידאו ארוכים לטובת חיפוש וקטלוג.

  • מענה לשאלות על הרצאות

    ניתוח הקלטות וידאו ומענה על שאלות שדורשות הבנה של מה שהוצג לאורך זמן.

איפה זה נופל

הנתונים מראים ירידה ברורה בביצועים ברגע שהווידאו מתארך, עם ציון של 60.6 בלבד בבחינות וידאו ארוך לעומת משימות קצרות יותר. בנוסף, שלב קידוד הווידאו גובה מחיר כבד בזמן הריצה ומוריד את קצב יצירת הטקסט מ־31.9 ל־21.3 טוקנים לשנייה. המודל גם מוגדר רשמית לאנגלית בלבד, כך שאי אפשר לסמוך עליו בעיבוד או הבנה של שיחות ועצמים בעברית בלי לבדוק אותו ישירות.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב אישי רגיל?

לא מומלץ. המודל שוקל 15.6GB ב־bfloat16 ודורש זיכרון גרפי נרחב עבור קידוד הווידאו וספריית Flash Attention 2. המפתחים עצמם בדקו אותו על כרטיס ייעודי של 80GB, כך שכרטיס ביתי פשוט ייחנק מיד.

איך המודל מסתדר עם סרטונים באורך של שעה?

הארכיטקטורה שלו דוחסת טוקנים בדיוק בשביל זה, אבל יש ירידה בדיוק. בבדיקות של LongVideoBench הציון עומד על 60.6, כך שצריך לבדוק טוב אם רמת הדיוק הזו מספיקה למקרה השימוש שלכם.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך רציני עם תמיכה ב־CUDA 12.1, התקנה של PyTorch 2.4.0 וחבילות עיבוד וידאו כמו decord ו־OpenCV, לצד Flash Attention 2. המודל שוקל 15.6 גיגה-בייט בפורמט bfloat16 ומכיל 8.4 מיליארד פרמטרים, כך שצריך כרטיס עם מספיק VRAM כדי להחזיק את המשקלים ואת הטוקנים של הפריימים.

בבדיקות של המפתחים על כרטיס A800 של 80GB, המודל ייצר כ־21 טוקנים לשנייה כולל שלב קידוד הווידאו, וכימות ל־INT4 העלה את הקצב ל־26 טוקנים לשנייה. אם אין לכם כרטיס מקצועי חזק, זמני הקידוד של הווידאו יאטו את העבודה משמעותית, ובמקרים כאלה עדיף לשקול שירות מנוהל.

from transformers import pipeline

pipe = pipeline("video-text-to-text", model="OpenGVLab/InternVideo2_5_Chat_8B")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר, בתנאי ששומרים על הודעת זכויות היוצרים ומציינים שינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗