GPT
N

NVIDIA-Nemotron-Nano-12B-v2-VL-FP8

קוד פתוח

nvidiaother2025-10-22

  • transformers
  • safetensors
  • nvidia
  • VLM
  • FP8

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה של מודל ראייה ושפה מבית אנבידיה עם 13 מיליארד פרמטרים וחלון הקשר של 128 אלף טוקנים. הוא פונה למי שצריך לפענח תמונות ומסמכים בדיוק גבוה על חומרת שרת תואמת.

  • 13Bפרמטרים
  • 14.4 GBמשקל הקבצים
  • 124,702הורדות בחודש
  • 52לייקים

מה זה

מדובר במודל ראייה ושפה שמשלב מקודד תמונה מסוג C-RADIOv2-H עם מודל שפה Nemotron Nano בנפח 13 מיליארד פרמטרים. המודל עבר קוונטיזציה לפורמט FP8 באמצעות כלי האופטימיזציה של אנבידיה כדי לחסוך מקום ולשמור על מהירות ריצה. הוא נועד לניתוח ויזואלי, פענוח טקסט מתמונות, שאלות ותשובות על גרפים ושרשראות חשיבה מבוססות טקסט.

התוצאות שלו במבחני ביצועים כמעט זהות למשקלי המקור בפורמט BF16. הוא מציג 94.3 אחוז במבחן DocVQA להבנת מסמכים ו־89.4 אחוז במבחן ChartQA לפיענוח גרפים, לצד ציון של 85.4 אחוז ב־OCRBench. הנתונים האלה מעידים על שמירה מדויקת של יכולות חילוץ נתונים חזותיים למרות הדחיסה.

מתאים ל

  • חילוץ נתונים מדוחות וגרפים

    המודל מגיע לדיוק של 89.4 אחוז במבחן ChartQA ומפרק תרשימים מורכבים להסברים טקסטואליים ברורים.

  • פיענוח מסמכים וחשבוניות

    עם ציון של 94.3 אחוז ב־DocVQA הוא מתאים למשימות קריאת טקסט וסריקת נתונים מטפסים.

  • ניתוח תמונות בהקשר ארוך

    חלון הקשר של 128 אלף טוקנים מאפשר לשלב הסברים מפורטים ושרשראות חשיבה יחד עם התמונה.

איפה זה נופל

המודל מוגבל לעיבוד של תמונה בודדת בכל קריאה ולא תומך בריבוי תמונות ברצף אחד. רזולוציית הקלט כפופה למבנה קשיח של עד 12 משבצות בגודל 512 על 512 פיקסלים, ותמונות עם ערוץ שקיפות מסוג אלפא אינן נתמכות כלל. בנוסף, רשימת השפות הנתמכות כוללת עשר שפות בלבד, ועברית אינה מופיעה בהן.

אותה משפחה

NVIDIA-Nemotron-Nano-12B-v2-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעיבוד קבצים בעברית?

לא מומלץ לבנות עליו למשימות כאלה. רשימת השפות הנתמכות כוללת אנגלית, סינית, גרמנית ועוד שבע שפות בלבד, כך שעברית לא נבדקה ולא הוגדרה כשפה רשמית במודל.

האם אפשר לשלוח כמה תמונות יחד באותה שאילתה?

לא. המודל מתוכנן ותומך בהרצה של תמונה אחת בלבד בכל קריאה, כך שאי אפשר להשוות ישירות בין מספר קבצים שונים.

איזה סוג חומרה דרוש להרצת המודל?

הבדיקות הרשמיות נערכו על גבי כרטיס שרת NVIDIA H100 SXM בנפח 80 גיגה־בייט. הרצה בסביבה אחרת דורשת תמיכה בחומרת אנבידיה ובחישובי FP8 דרך מנוע vLLM.

איך מריצים

המודל שוקל 14.4 גיגה־בייט ומיועד להרצה בסביבת לינוקס דרך מנוע vLLM באמצעות דוקר ייעודי ופקודת שרת מובנית. החומרה שנבדקה ונתמכת רשמית על פי הדף היא כרטיס בודד של NVIDIA H100 SXM בנפח 80 גיגה־בייט זיכרון, יחד עם תלויות מערכת ספציפיות כמו mamba-ssm וגרסאות מוגדרות של transformers.

אם אין לכם גישה למאיצי שרת חזקים שתומכים בחישובי FP8 בצורה חלקה, עדיף להשתמש בנקודת קצה מנוהלת דרך שירותי ענן ולא להסתבך עם התקנה מקומית מורכבת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/NVIDIA-Nemotron-Nano-12B-v2-VL-FP8")
print(pipe("שלום"))

הרישיון

השימוש כפוף להסכם הרישיון הפתוח של אנבידיה שמוגדר תחת רישיון ייעודי. מותר להשתמש בו לצרכים מסחריים ופנימיים בכפוף למגבלות המשפטיות של ההסכם והקפדה על כללי השימוש הנאותים של החברה.

הרישיון המלא בעמוד המודל ↗