GPT
N

NVIDIA-Nemotron-Nano-12B-v2-VL-BF16

קוד פתוח

nvidiaother2025-10-21

  • transformers
  • safetensors
  • nvidia
  • VLM
  • image-text-to-text

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זה מודל ראייה ושפה קומפקטי שמכוון במפורש לפענוח מסמכים מרובי עמודים וקטעי וידאו. הוא מתאים למי שחייב להריץ עיבוד חשבוניות ותרשימים מקומית בלי לחנוק את השרת.

  • 13Bפרמטרים
  • 24.6 GBמשקל הקבצים
  • 31,670הורדות בחודש
  • 90לייקים

מה זה

מדובר במודל מולטימודלי של 12.6 מיליארד פרמטרים שמשלב אנקודר תמונה בשם CRadioV2-H עם מודל שפה של אנבידיה. הוא יודע לקבל קלט של טקסט לצד עד ארבע תמונות ברזולוציה גבוהה או וידאו של עד 128 פריימים, ומחזיר טקסט בתוך חלון הקשר ענק של 128 אלף טוקנים.

במבחני הביצועים הוא מראה חוזק קיצוני בנתונים מובנים מתוך קבצים. ציון של 94.39 ב־DocVQA ו־89.72 ב־ChartQA מציב אותו ככלי חד מאוד לקריאת גרפים, טבלאות וטפסים מורכבים. מנגד, במבחן של הסקת מסקנות עמוקה מתוך טקסט בתמונות הוא מוציא 36.4 בלבד, כך שלא כדאי לבנות עליו לפלפולים לוגיים מסובכים.

מתאים ל

  • חילוץ נתונים מדוחות כספיים

    הדיוק הגבוה בטבלאות וגרפים מאפשר לשלוף מספרים מתוך דוחות באנגלית ביעילות גבוהה.

  • עיבוד חשבוניות ספקים

    הוא מטפל בעד ארבעה עמודי מסמך בבת אחת ושולף שדות מדויקים בזכות התמחות ייעודית בטפסים.

  • תמצות קטעי וידאו קצרים

    מנתח עד 128 פריימים של צילום ומייצר תיאור טקסטואלי של מה שקורה בסרטון.

איפה זה נופל

הקלט מוגבל לארבע תמונות בלבד בכל הרצה, ואין תמיכה בקובצי תמונה עם שקיפות. בנוסף, פענוח הווידאו לא מובנה, ואתם מחויבים לחתוך את הסרטון לפריימים בעצמכם עם ffmpeg לפני השליחה.

המגבלה הקריטית ביותר לישראל היא השפה. המודל תומך באנגלית בלבד. אם יש לכם חשבוניות בעברית, טפסים ממשלתיים מקומיים או וידאו עם כיתוב בעברית, המודל פשוט לא בנוי להתמודד איתם וייכשל בזיהוי.

אותה משפחה

NVIDIA-Nemotron-Nano-12B-v2-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לשלוח אליו קובץ וידאו בפורמט MP4 ישירות?

לא. המודל תומך בקלט וידאו רק אחרי שחילקתם אותו לתמונות בודדות מראש בעזרת כלי חיצוני, בקצב שבין 8 ל־128 פריימים.

האם הוא מתאים לזיהוי מסמכים בעברית?

הכרטיס מגדיר תמיכה באנגלית בלבד. ניתוח מסמכים, חוזים או קבלות בעברית ייכשל או יחזיר תוצאות משובשות.

איך מריצים

כדי להריץ את גרסת ה־BF16 ששוקלת 24.6 גיגה-בייט, צריך כרטיס מקצועי עם 32 עד 40 גיגה-בייט זיכרון גרפי כמו A100 או L40S, במיוחד כשפותחים חלון הקשר גדול וטוענים תמונות כבדות. אנבידיה מציעה גם גרסאות FP8 ו־FP4 שמורידות את דרישות החומרה לכרטיסים נגישים בהרבה.

ההרצה המקומית נתמכת דרך vLLM ו־SGLang, אבל דורשת התקנת תלויות ייעודיות כמו causal_conv1d ו־mamba-ssm. אם אין לכם שרת ייעודי שרץ על לינוקס ועיקר הצורך הוא קריאות בודדות פה ושם, עדיף לפנות ל־API ב־build.nvidia.com במקום לתחזק מכונה יקרה בענן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/NVIDIA-Nemotron-Nano-12B-v2-VL-BF16")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License Agreement. הרישיון מתיר שימוש מסחרי ומאפשר להטמיע אותו במוצרים, אך אינו קוד פתוח חופשי לחלוטין. הוא מחייב ציות לתנאי הרישיון של אנבידיה ואינו כולל ויתור על תנאי השימוש שהחברה מכתיבה להפצה.

הרישיון המלא בעמוד המודל ↗