GPT
N

NVILA-8B-HD-Video

קוד פתוח

nvidiacc-by-nc-4.02026-03-11

  • pytorch
  • nvila
  • AutoGaze
  • NVILA
  • custom_code

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הוא מנתח וידאו ברזולוציה של עד 4K ועד 1K פריימים בלי לחנוק את החומרה. הפתרון מיועד למי שחייב להריץ מודל שמונה מיליארד פרמטרים על סרטונים כבדים.

  • 32,768טוקנים בהקשר
  • 15.1 GBמשקל הקבצים
  • 6,043הורדות בחודש
  • 41לייקים

מה זה

רוב המודלים הרב מודליים בגודל הזה מתקשים להתמודד עם קובצי וידאו ארוכים או כבדים, מפני שכמות הטוקנים שנוצרת מכל פריים מפוצצת את הזיכרון במהירות. כאן שילבו מנגנון שנקרא AutoGaze, שמסנן חלקים מיותרים מתוך הפריימים עוד לפני שהם מגיעים למקודד התמונה או לשפת המודל. הסינון הזה מסוגל להפחית עד פי 100 את כמות הטוקנים בווידאו, מה שמתרגם לירידה של עד פי 19 בזמני הריצה של רכיב הראייה ועד פי 10 במודל השפה.

הבסיס נשען על NVILA-Lite-8B ועל רכיבים מתוך Qwen2-VL-7B-Instruct, לצד אימון על 72 מאגרי נתונים שונים בחמישה שלבים. לפי הנתונים הוא משפר תוצאות במבחן VideoMME ומציג ביצועים מובילים במבחן HLVid, שבודק הבנה של סרטונים ארוכים ברזולוציה גבוהה. בשורה התחתונה מקבלים יכולת תשאול ופענוח על וידאו מורכב בתוך מעטפת חישובית שקרובה למודל שפה סטנדרטי.

מתאים ל

  • תחקור צילומי אבטחה ושטח

    זיהוי אירועים ופעולות בקבצים כבדים של 4K ועד 1K פריימים בלי צורך לדגום מראש באיכות ירודה.

  • ניתוח תוכן לספריות מדיה

    חילוץ תובנות ומענה לשאלות מתוך סרטים ותוכניות ארוכות ישירות מהווידאו הגולמי.

  • מחקר אקדמי על עיבוד וידאו

    בדיקת שיטות חדשות לדחיסת טוקנים וצמצום זמני ריצה של מודלי ראייה גדולים.

איפה זה נופל

למרות ההבטחה לטיפול בפורמטים כבדים, הכרטיס מבהיר במפורש שהמודל מיועד למחקר ופיתוח בלבד, ולא נמסר כמערכת מוכנה לייצור. בנוסף, חובה להריץ את רכיב AutoGaze כשלב מקדים כדי לקבל את החיסכון בביצועים, מה שמסרבל את צינור העבודה ולא מאפשר להשתמש בספריות סטנדרטיות בלי התאמות קוד. המפתחים עצמם מציינים שנדרשת בדיקה מעמיקה של דיוק ובטיחות על הנתונים שלכם לפני כל שימוש אמיתי.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך מוצר מסחרי?

לא. הרישיון הוא לא מסחרי, ומיועד לצורכי מחקר ופיתוח בלבד. אם המערכת שלכם מיועדת להפצה עסקית, תצטרכו לחפש מודל אחר.

איך אפשר לטעון אותו ישירות דרך קוד סטנדרטי?

לא ניתן להסתפק בקריאה פשוטה רגילה, משום שהוא תלוי ברכיב AutoGaze לסינון הטוקנים ודורש התקנה מגיטהאב לפי ההוראות של VILA.

איך מריצים

כדי להריץ אותו בפועל צריך להתקין תחילה את חבילת AutoGaze מגיטהאב ואת הקוד של VILA. הקבצים שוקלים 15.1 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם זיכרון ייעודי מתאים, כשהבדיקות של המפתחים עצמם נעשו על חומרת NVIDIA A100. הוא נתמך בארכיטקטורות Ampere, Hopper, Blackwell וגם בסדרת Jetson, תחת מערכות לינוקס, חלונות או QNX.

אין כאן שירות ענן מנוהל מוכן או ממשק API מרוחק שזמין ישירות מהיוצרים, ולכן חובה להקים את סביבת הריצה בעצמכם על תשתית מקומית או לשכור שרת ייעודי.

pip install -U huggingface_hub
hf download nvidia/NVILA-8B-HD-Video

הרישיון

הרישיון המוגדר הוא שילוב של cc-by-nc-4.0 וגרסת CC-BY-NC-SA-4.0, יחד עם תנאי Apache 2.0 עבור רכיב הבסיס. המשמעות ברורה וחדה, השימוש מותר למטרות מחקר ופיתוח בלבד, וחל איסור מוחלט על שימוש מסחרי מכל סוג שהוא במוצר שמכניס כסף.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗