GPT
L

Llama-3.1-Nemotron-Nano-VL-8B-V1

קוד פתוח

nvidiaother2025-06-03

  • transformers
  • safetensors
  • nvidia
  • VLM
  • llama3.1

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל ראייה ושפה קומפקטי שמחבר מקודד תמונה מתקדם לבסיס של לאמה, ומיועד לפענוח מסמכים ותרשימים מקומי. הוא מתאים למי שחייב לעבד גרפיקה וטקסט בלי להוציא מידע לענן.

  • 8.7Bפרמטרים
  • 16.3 GBמשקל הקבצים
  • 96,904הורדות בחודש
  • 181לייקים

מה זה

המודל משלב בין מקודד התמונה C-RADIOv2-H לבין מודל השפה Llama-3.1-8B-Instruct, ומכוון ספציפית לניתוח מסמכים ותמונות. בשונה ממודלים כלליים שמתקשים בפרטים קטנים, הוא מפרק תמונות למערך של עד 12 אריחים ברזולוציה של 512 על 512 פיקסלים, מה שמאפשר לו לקרוא תוכן חד ומפורט ברזולוציות גבוהות.

במבחני הביצועים הוא מציג תוצאות חזקות בעיקר במשימות מובנות, עם 91.2 אחוזים ב־DocVQA ו־86.3 אחוזים ב־ChartQA. זה מראה שהחוזק העיקרי שלו הוא חילוץ מידע מדוחות, גרפים וטבלאות, ולאו דווקא ניתוח כללי של תמונות מורכבות בעולם האמיתי.

מתאים ל

  • חילוץ נתונים מדוחות כספיים

    שליפת מספרים מתוך טבלאות וגרפים באנגלית בדיוק גבוה בזכות תוצאה של 86.3% במבחן ChartQA.

  • קריאת מסמכים סרוקים

    זיהוי תווים וניתוח טפסים מורכבים ברזולוציה של עד 12 אריחים ללא צורך בענן חיצוני.

  • עיבוד תמונה במכשירי קצה

    הרצה מקומית על כרטיסי Jetson Orin באמצעות כיול ל־4 ביט עבור מערכות עצמאיות בשטח.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא השפה, המודל תומך רשמית באנגלית בלבד ולא מיועד לעברית. בנוסף, הוא לא מקבל ערוץ שקיפות בתמונות, ומוגבל ל־16 אלף טוקנים משולבים של קלט ופלט יחד. בבדיקות של OCRBenchV2 בסינית הוא הגיע ל־37.9 אחוזים בלבד לעומת 60.1 אחוזים באנגלית, כך שמחוץ לאנגלית הביצועים שלו נופלים דרמטית. כמו כן, קיים כבר דגם Nemotron Nano v2 חדש יותר בנפח 12B.

שאלות
נפוצות

האם המודל תומך במסמכים וטקסט בעברית?

הכרטיס מציין במפורש תמיכה באנגלית בלבד. כל ניסיון לעבד מסמך בעברית יוביל לתוצאות לא יציבות, הזיות או כישלון מוחלט בפענוח הטקסט.

איזה כרטיס מסך מינימלי צריך כדי להריץ אותו בלי שרת ארגוני?

בגרסה המלאה תצטרכו כרטיס של 24 גיגה-בייט VRAM כמו RTX 3090 או RTX 4090. אם משתמשים בגרסה מכוילת ל־4 ביט ב־TinyChat, אפשר לרדת לדרישות זיכרון נמוכות בהרבה.

איך מריצים

במשקל של 16.3 גיגה-בייט בגרסת המקור, תצטרכו כרטיס מסך עם לפחות 24 גיגה-בייט זיכרון כדי להריץ אותו בלי שייחנק. אנבידיה בדקה אותו על חומרת H100 עם מנוע TensorRT-LLM, אבל אפשר להריץ אותו גם דרך ספריית transformers הרגילה בלינוקס. שימוש בקוונטיזציה של 4 ביט דרך TinyChat מאפשר לדחוף אותו למחשבים ניידים ולכרטיסי Jetson Orin.

אם אין לכם כרטיס גרפי מתאים במערך השרתים או שאתם לא צריכים פרטיות מוחלטת של המידע, עדיף לפנות ל־API של אנבידיה במקום להחזיק תשתית ייעודית שתעלה הרבה יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/Llama-3.1-Nemotron-Nano-VL-8B-V1")
print(pipe("שלום"))

הרישיון

השימוש כפוף לשילוב בין הרישיון הפתוח של אנבידיה לבין רישיון הקהילה של Llama 3.1. מותר להשתמש בו לצרכים מסחריים, אך יש לעמוד בכל תנאי השימוש והמגבלות של מטא ואנבידיה, כולל חובת ציון המקור בנוסח Built with Llama.

הרישיון המלא בעמוד המודל ↗