GPT
N

NVIDIA-Nemotron-Parse-v1.2

קוד פתוח

nvidiaother2026-02-18

  • transformers
  • safetensors
  • nemotron_parse
  • feature-extraction
  • VLM

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הוא ממיר עמודי מסמכים למרק־דאון מובנה ושומר על סדר קריאה טבעי. פתרון ממוקד של פחות ממיליארד פרמטרים שמוציא גם תיחום מרחבי וסיווג אלמנטים בלי להעמיס על השרת.

  • 936Mפרמטרים
  • 3.5 GBמשקל הקבצים
  • 52,352הורדות בחודש
  • 71לייקים

מה זה

במקום להפעיל מודל רב־מודאלי ענק שזולל משאבים, הקובץ הזה שוקל 3.5 גיגה־בייט ומיועד למשימה אחת בלבד: קריאת מסמכים סרוקים, קובצי פי־די־אף ומצגות. הארכיטקטורה משלבת מקודד תמונה מסוג ViT-H עם מפענח mBART מכווץ, מה שמייצר מחרוזת טקסט הכוללת תיבות גבול, סוגי פסקאות וסדר קריאה רציף של הערות שוליים, כותרות וטבלאות.

בגרסה 1.2 נוספה שליטה ישירה בחילוץ טקסט מתוך תמונות ותרשימים דרך הפרומפט. אפשר לבקש ממנו להתעלם מטקסט שמופיע בתוך איורים כדי לקצר את זמני הריצה, ועיבוד הטבלאות מאפשר להמיר אותן ישירות לפורמטים כמו לטך, סי־אס־וי, ג'ייסון או מרק־דאון בלי צורך בעוד שלב פענוח.

מתאים ל

  • עיבוד דוחות ומאמרים ל־RAG

    ממיר קובצי פי־די־אף למרק־דאון נקי ושומר על סדר הקריאה בין עמודות, טבלאות והערות שוליים.

  • שליפת נתונים מטבלאות

    מחלץ מבנה נתונים מורכב ישירות לפורמט ג'ייסון או סי־אס־וי באמצעות מעבד לוגיטים מובנה.

  • סימון וסיווג אלמנטים חזותיים

    מייצר קואורדינטות מדויקות של כותרות, תמונות ופסקאות לצורך אימון מודלים או ארכוב.

איפה זה נופל

הוא מוגבל לרזולוציית קלט קבועה יחסית של עד 2048 על 1664 פיקסלים, כך שמסמכים צפופים מדי או שרטוטים הנדסיים מורכבים עלולים לאבד פרטים. האנבידיה מצרפת מעבדי לוגיטים מיוחדים כדי לעצור חזרות אינסופיות והזיות של תיבות סימון, מה שמעיד על נטייה להיתקע בלולאות טקסט אם לא מרסנים אותו.

חובה גם להקפיד על הפרומפט המדויק בעל ארבעת הטוקנים. אם תשכחו את הטוקן הרביעי שמגדיר טיפול בתמונות, הביצועים שלו ייפגעו קשות בלי שתקבלו שגיאה מפורשת בזמן ריצה.

אותה משפחה

NVIDIA-Nemotron-Parse יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מסוגל לחלץ טבלאות סרוקות ישירות לתוך קובץ אקסל?

הוא לא מייצר קובצי אקסל ישירות, אבל הוא מחלץ את הטבלה למחרוזת סי־אס־וי, לטך או ג'ייסון. סקריפט הפוסט־פרוססינג המצורף מאפשר לתרגם את הפלט לקובץ נתונים טבלאי בקלות.

האם אפשר להריץ אותו על מעבד רגיל בלי כרטיס גרפי?

טכנית ספריות כמו טרנספורמרס מאפשרות טעינה, אבל הכרטיס מותאם ומיועד בלעדית לסביבות מואצות של אנבידיה עם קודה. ריצה על מעבד בלבד תהיה אטית להחריד ולא מעשית לייצור.

איך מריצים

הוא נתמך ישירות ב־vLLM וב־TensorRT-LLM ומיועד לכרטיסי אנבידיה מסדרות טיורינג, אמפר, הופר ובלאקוול, כשרצים על לינוקס בלבד. מפתח הזיכרון הנדרש קטן למדי וכרטיס A10 בודד או אפילו חומרה צנועה יותר יריצו אותו בלי בעיה, במיוחד אם מפעילים את מעבד הטריטון המומלץ להאצה.

בניגוד לשירותי ענן קנייניים, ההרצה כאן עצמאית לחלוטין ומתאימה למי שמעבד מסמכים רגישים שאסור להוציא החוצה. אם אין לכם תשתית לינוקס ייעודית עם כרטיס תואם, תצטרכו להרים שרת מנוהל או להשתמש בממשק חיצוני, כי אין כאן תמיכה נוחה בסביבות אחרות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/NVIDIA-Nemotron-Parse-v1.2")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון המודלים הפתוחים של אנבידיה יחד עם רישיון קריאייטיב קומונס 4.0 עבור הטוקנייזר. מותר להשתמש בו במוצרים מסחריים גלובליים, אך כפוף לתנאי השימוש הספציפיים שאנבידיה מכתיבה בהסכם שלהם.

הרישיון המלא בעמוד המודל ↗