GPT
N

NVIDIA-Nemotron-Parse-v1.1

קוד פתוח

nvidiaother2025-11-15

  • transformers
  • safetensors
  • nemotron_parse
  • feature-extraction
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הופך צילומי עמודים מורכבים לטקסט מובנה עם מיקומים וקטגוריות לכל אלמנט. מתאים למי שצריך חילוץ מדויק מטבלאות ומשוואות בלי להחזיק מודל ענק.

  • 957Mפרמטרים
  • 3.6 GBמשקל הקבצים
  • 154,941הורדות בחודש
  • 171לייקים

מה זה

מדובר במודל ראייה ושפה קומפקטי שמיועד לניתוח מסמכים כמו קובצי PDF ומצגות. הוא לוקח תמונה של עמוד ומחזיר מחרוזת אחת שכוללת את סדר הקריאה הנכון, הטקסט עצמו במרקאון, מיקומי תיחום לכל רכיב וסיווג לפי סוג האלמנט, כמו כותרת, טבלה, הערת שוליים או תמונה.

המבנה הפנימי מחבר אנקודר תמונה מסוג ViT-H עם שכבת כיווץ ייעודית ומפענח mBart של עשרה בלוקים. גולת הכותרת כאן היא טיפול באלמנטים שוברי OCR רגילים, כמו טבלאות מרובות שורות ועמודות שנפלטות ישירות בפורמט LaTeX, ונוסחאות מתמטיות מורכבות שנשמרות עם תחביר תואם.

מתאים ל

  • הכנת דאטה למודלי שפה

    חילוץ נקי של טקסט לפי סדר קריאה אמיתי מקובצי PDF ישנים ומורכבים.

  • פיענוח טבלאות מדעיות

    המרה מדויקת של מבני טבלאות מרובי עמודות ישירות לקוד LaTeX.

  • צינורות עיבוד RAG

    חלוקת מסמכים לפי כותרות ופסקאות עם שמירה על הקשר מרחבי וסוגי תוכן.

איפה זה נופל

המגבלה הראשונה היא גמישות הקלט. המודל דורש רזולוציה בטווח שבין 1024 על 1280 לבין 1648 על 2048, כך שתמונות קטנות מדי או ענקיות ידרשו התאמה מראש. בנוסף, חילוץ המידע מחייב קוד עיבוד נוסף כדי לפרק את המחרוזת החוזרת לתיבות אמיתיות ולהמיר את הקואורדינטות חזרה לגודל התמונה המקורי. מי שצריך תמיכה במסמכים בעברית חייב לבדוק אותו ידנית, כי דפי המודל לא מפרטים תמיכה בשפות שאינן אנגלית.

אותה משפחה

NVIDIA-Nemotron-Parse יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה פורמט פלט מקבלים בריצת ברירת המחדל?

הפלט מתקבל כמחרוזת טקסט רציפה הכוללת תגיות מיקום, סיווג של כל רכיב, טקסט רגיל במרקאון וטבלאות או נוסחאות בפורמט LaTeX. כדי להשתמש בזה בקוד נדרש שלב פענוח שממיר את התוצאה למבנה נתונים מסודר.

האם המודל מחייב חומרה של אנבידיה כדי לעבוד?

כן, המודל תוכנן ונבדק על מעבדי אנבידיה בסביבת לינוקס, ונתמך במנועי הרצה כמו TensorRT-LLM ו־vLLM. הרצה על חומרה אחרת או על מעבד בלבד אינה נתמכת באופן רשמי.

איך מריצים

בזכות משקל של פחות ממיליארד פרמטרים וקבצים בנפח של 3.6 גיגה בייט, קל להריץ אותו מקומית על כרטיסי אנבידיה מסדרות Turing, Ampere או Hopper תחת לינוקס. יש תמיכה מובנית בשרתי vLLM החל מגרסה 0.14.1, כאשר בכרטיסי A100 או A10 מומלץ להפעיל את מנוע הקשב של טריטון.

מי שלא רוצה לתחזק שרת עצמאי יכול למשוך קונטיינר NIM מוכן או לפנות לממשק בענן של אנבידיה. יש גם גרסה מותאמת בשם TC שמתעדפת מהירות, וגרסה מעודכנת יותר בשם v1.2.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/NVIDIA-Nemotron-Parse-v1.1")
print(pipe("שלום"))

הרישיון

השימוש במודל כפוף לרישיון הדגמים הפתוחים של אנבידיה שמתיר שימוש מסחרי, בעוד רכיב הטוקנייזר מופץ תחת CC-BY-4.0. מי שבוחר להשתמש בקונטיינר ה־NIM כפוף להסכמי התוכנה הארגוניים של החברה.

הרישיון המלא בעמוד המודל ↗