GPT
N

NVLM-D-72B

קוד פתוח

nvidiacc-by-nc-4.02024-09-30

  • transformers
  • safetensors
  • NVLM_D
  • nvidia
  • NVLM

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל ראייה ושפה ענק של אנבידיה שמתחרה בביצועים של מערכות סגורות. בניגוד לרוב מודלי הראייה, האימון הרב־תחומי לא פגע לו ביכולות הטקסטואליות אלא שיפר אותן.

  • 79Bפרמטרים
  • 165 GBמשקל הקבצים
  • 12,774הורדות בחודש
  • 776לייקים

מה זה

המודל מחבר את Qwen2-72B כבסיס טקסטואלי יחד עם מקודד תמונה InternViT-6B, מה שמביא אותו לסך של כמעט 80 מיליארד פרמטרים. הוא מקבל תמונות וטקסט ומחזיר טקסט בלבד, עם חלון הקשר של 128 אלף טוקנים. השימוש העיקרי כאן הוא פיענוח תרשימים, קריאת מסמכים, ניתוח חזותי וזיהוי תווים.

במבחני ביצועים הוא עוקף מודלים סגורים בנקודות ספציפיות, למשל ציון 852 במבחן OCRBench מול 736 של GPT-4o, וציון 65.2 ב־MathVista. מעבר למשימות ראייה, במבחני טקסט טהורים כמו מתמטיקה וקוד המודל הציג שיפור לעומת מודל הבסיס שלו, בניגוד למודלים מקבילים שמפגינים ירידה בביצועי טקסט ברגע שמלמדים אותם לעבד תמונות.

מתאים ל

  • חילוץ נתונים מדוחות וטבלאות

    התוצאות במבחן OCRBench ו־DocVQA מצביעות על דיוק גבוה במיוחד בקריאת מסמכים סרוקים ותרשימים באנגלית.

  • פתרון בעיות מתמטיות חזותיות

    המודל השיג 65.2 ב־MathVista, מה שהופך אותו לאחד הכלים החזקים לניתוח שאלות עם איורים וגרפים.

  • מחקר אקדמי על מודלי מולטימודל

    המשקולות פתוחות ורישיון השימוש מאפשר בדיקות מעבדה והשוואות ישירות מול מערכות מסחריות סגורות.

איפה זה נופל

המודל פולט טקסט בלבד ואינו מסוגל לייצר תמונות בשום צורה. בנוסף, הוא מסומן רשמית עבור השפה האנגלית בלבד, כך שאין שום הבטחה לתמיכה בעברית, בניתוח מסמכים מקומיים או בקריאת גרפים עם פונטים בעברית. יש פערים קלים בתוצאות המדידה בין הרצה בסביבת המקור Megatron לבין הרצה בספריית Transformers של HuggingFace.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך אפליקציה בתשלום?

לא. המודל מופץ תחת רישיון לא מסחרי בלבד. אם המוצר שלכם מסחרי, תצטרכו לחפש אלטרנטיבה ברישיון חופשי.

האם הוא יקרא חשבוניות או מסמכים בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. סביר להניח שפענוח תווים בעברית יציג תוצאות שבורות ולא אמינות, במיוחד במסמכים סרוקים.

מה צריך כדי להריץ אותו עצמאית?

צריך שרת לינוקס עם לפחות שניים עד ארבעה כרטיסי מסך ברמת שרת עם זיכרון משותף של מעל 170 גיגה בייט, וסביבת PyTorch מתאימה.

איך מריצים

משקל הקבצים עומד על 165 גיגה בפורמט bfloat16, מה שאומר שאי אפשר להריץ אותו על שום כרטיס בודד לצרכנים. אנבידיה בדקה אותו על חומרת הופר H100 תחת לינוקס, ובפועל תצטרכו שרת עם מספר מאיצים גרפיים בעלי זיכרון גבוה כדי לטעון אותו אפילו להסקה בסיסית דרך Transformers.

אם אין לכם קלאסטר של כמה כרטיסי שרת זמינים, אין היגיון טכני לנסות להרים אותו מקומית. עדיף להשתמש בפתרונות API קיימים או לחכות לגרסאות מכווצות בקוונטיזציה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/NVLM-D-72B")
print(pipe("שלום"))

הקבצים

72 קבצים במאגר, 165 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0, כלומר שימוש לא מסחרי בלבד. אסור לשלב אותו בשום מוצר שמייצר הכנסה, בתוך שירות בתשלום או כחלק ממערכת עסקית. השימוש מותר רק למחקר, ניסויים פנימיים או פרויקטים ללא מטרת רווח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗