GPT
O

omnivinci

קוד פתוח

nvidiaapache-2.02025-08-22

  • transformers
  • safetensors
  • vila
  • feature-extraction
  • omni-modal

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

פיתוח מולטימודלי של אנבידיה שמשלב הבנת תמונה, וידאו ואודיו יחד עם טקסט. מי שמחפש מודל שמסוגל לעבד קלט של וידאו יחד עם פס הקול שלו ימצא כאן נקודת עניין מחקרית.

  • 16.3 GBמשקל הקבצים
  • 127הורדות בחודש
  • 178לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת VILAForCausalLM ומיועד להבנה רב-מודלית כוללת, מה שנקרא omni-modal. בניגוד למודלי ראייה סטנדרטיים שעוצרים בתמונות או בפריימים דוממים, כאן המטרה היא להאזין, לראות, לקרוא ולהסיק מסקנות במקביל. הוא מעבד וידאו עם אודיו מחובר, מה שמאפשר לנתח אינטראקציות שלמות ולא רק רצף תמונות אילם.

אנבידיה פיתחה אותו כחלק מפרויקט מחקר סביב ארכיטקטורה ואימון נתונים עבור מודלים שמשלבים כמה חושים. לפי כרטיס המודל, הוא מציג ביצועים מהשורה הראשונה במבחני ביצועים של הבנת קול, תמונה ומדיה מעורבת, אם כי המדדים המדויקים מופיעים בגרפים חיצוניים ולא מפורטים בטקסט עצמו. המודל מתממשק ישירות עם ספריית transformers, כך שאפשר לשלב אותו בסקריפטים קיימים בלי לכתוב שכבות תיאום מאפס.

מתאים ל

  • ניתוח וידאו ואודיו יחד

    הוא מטפל בסרטונים שכוללים קול במקום לפצל את הראייה והשמע למודלים שונים.

  • מחקר מודלים רב-חושיים

    הוא מציע בסיס קוד של אנבידיה לבחינת שילוב מודלי שפה עם קלט ויזואלי וקולי.

  • תמלול והבנת שמע בהקשר

    הוא מאפשר לבחון מטלות שמע לצד הקשר של תמונה דרך סקריפטים ייעודיים שמצורפים אליו.

איפה זה נופל

הבעיה הבולטת ביותר היא הבלבול המשפטי, המטא-דאטה מדווח על רישיון חופשי אבל הטקסט מפנה לרישיון לא-מסחרי קשוח של אנבידיה, כך שאי אפשר לבנות עליו מוצר בלי בדיקה משפטית. מעבר לזה, הכרטיס כמעט לא חושף מגבלות טכניות, חולשות בעיבוד שפות שאינן אנגלית, או את היקף ההזיות שלו על גבי אודיו ווידאו.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך אפליקציה מסחרית?

לא מומלץ כרגע. למרות שברישיון המדווח מופיע apache-2.0, בהסכם השימוש של אנבידיה בכרטיס המודל רשום רישיון לא-מסחרי מפורש. שימוש מסחרי חושף אתכם להפרת תנאי השימוש של אנבידיה.

איך מתחילים לעבוד איתו בפועל?

מושכים את הקבצים מתוך המאגר, מריצים את קובץ הגדרת הסביבה שמבוסס על NVILA, ומשתמשים בקוד הדוגמה להרצה על קובצי וידאו, שמע ותמונות שנמצאים בספרייה.

איך מריצים

כדי להריץ אותו צריך להוריד כ־16.3 גיגה-בייט של קבצים ולהתקין סביבת פייתון ייעודית שמבוססת על קוד NVILA דרך סקריפט ההתקנה שמגיע במאגר. גודל כזה של משקלים דורש כרטיס מסך עם זיכרון וידאו מכובד, כנראה לפחות 24 גיגה-בייט של VRAM כדי לטעון אותו ולבצע היקש על וידאו ואודיו בלי להיחנק.

אם אין לכם גישה לכרטיסי עיבוד מתאימים או שאין לכם עניין להתעסק בתלויות של סביבת NVILA, ההתקנה המקומית עלולה להיות כאב ראש. במקרים כאלה עדיף לחכות שיהיה שירות ענן שמנגיש אותו דרך ממשק פשוט, במקום לתחזק שרת ייעודי רק בשביל הניסוי הזה.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="nvidia/omnivinci")
print(pipe("שלום"))

הרישיון

יש פה סתירה ישירה. בעוד שהאתר מציג רישיון מסוג apache-2.0 שמאפשר שימוש חופשי ומסחרי, גוף הטקסט קובע במפורש שהמודל שוחרר תחת NVIDIA OneWay Noncommercial License. המשמעות היא שכרגע אסור לשלב אותו בשום מוצר מסחרי, אלא רק להשתמש בו למחקר פנימי ובדיקות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗