GPT
N

NVIDIA-Nemotron-Parse-2.0

קוד פתוח

nvidiaopenmdw-1.12026-06-30

  • transformers
  • safetensors
  • nemotron_parse
  • feature-extraction
  • VLM

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל ראייה ושפה קומפקטי שמחלץ ממסמכים טקסט, טבלאות, דיאגרמות ותיבות מיקום מדויקות. הוא מיועד למי שצריך לפענח סריקות מורכבות ישירות למבנה נתונים מסודר.

  • 903Mפרמטרים
  • 3.4 GBמשקל הקבצים
  • 27,831הורדות בחודש
  • 110לייקים

מה זה

המודל ממיר תמונות של מסמכים, שקפים ודוחות לייצוג טקסטואלי שמכיל גם סדר קריאה וגם חלוקה לאלמנטים כמו כותרות, פסקאות, הערות שוליים וטבלאות. בגרסה הזו נוספה היכולת לזהות אזורי תרשימים באמצעות תג ייעודי ולהמיר אותם למבנה של טבלה, לצד הרחבה של אוצר המילים בכעשרים אלף טוקנים כדי לשפר פענוח בשפות שונות.

התוצאות במבחני הביצועים מראות שיפור ניכר מול גרסה 1.2, בעיקר בתחומים שבהם גרסאות קודמות התקשו. במבחן MOSCAR הרב-לשוני ציון ה־F1 זינק מ־0.441 ל־0.910, ובמבחן כתב היד של OmniDocBench מרחק העריכה ירד מ־0.973 ל־0.339. המשמעות היא שהמודל הנוכחי מחלץ טקסט מורכב וסריקות לא מושלמות בדיוק גבוה משמעותית.

מתאים ל

  • חילוץ נתונים מדוחות ותרשימים

    זיהוי אזורי גרפים והפיכת המידע שבהם לטקסט מובנה כמו CSV או JSON.

  • הכנת מסמכים למערכות RAG

    פירוק קובצי PDF וסריקות למקטעים לפי סדר קריאה נכון עם תיבות מיקום.

  • פענוח טפסים עם הערות בכתב יד

    קריאת טקסט שאינו מודפס בזכות שיפור משמעותי במרחק העריכה בסריקות מסוג זה.

איפה זה נופל

המודל פועל בצורה מיטבית רק בטווח רזולוציות מוגדר, בין 1024 על 1280 ל־1664 על 2048 פיקסלים, כך שתמונות קטנות מדי או ענקיות ידרשו התאמה מראש. מעבר לכך, המפתחים כללו במאגר מעבדי logits מיוחדים למניעת הזיות שבהן המודל נתקע בלולאות חזרתיות של קואורדינטות, או כדי לכפות מבנה טבלאי כשגוזרים חלקי תמונה. בנוסף, אף שהמבחנים הרב-לשוניים מכסים עברית ושפות נוספות, הזינוק המרכזי שדווח במפורש בכרטיס נוגע לכתב יד ולשפות הודיות ואסייתיות, כך שחובה לבדוק איכות חילוץ בעברית באופן מעשי.

שאלות
נפוצות

האם המודל מחזיר ישירות קובץ אקסל או מבנה נתונים מוכן?

הוא פולט מחרוזת טקסט שמכילה את הטקסט, הסיווגים והקואורדינטות. בעזרת כלי העיבוד המצורפים למאגר אפשר להמיר את הפלט למבני נתונים כמו Markdown, JSON, HTML או CSV.

איך שולטים במה שהמודל מחלץ מהתמונה?

השליטה נעשית באמצעות טוקנים ייעודיים בבקשת הקלט. אפשר להנחות אותו לחלץ תיבות מיקום וטקסט, לוותר על טקסט שמופיע בתוך איורים, או לבקש רק סיווגים וקואורדינטות בלי לפענח את התוכן עצמו.

איך מריצים

עם 903 מיליון פרמטרים ומשקל קבצים של 3.4 גיגה-בייט, אפשר להריץ אותו בקלות על כרטיס מסך בודד כמו A10, A100 או כרטיסים בארכיטקטורת Turing, Ampere, Hopper ו־Blackwell. ההרצה נתמכת בסביבת לינוקס דרך ספריית transformers או שרת vLLM מגרסה 0.20 עד 0.26, כשהוא דורש שימוש בדיוק bfloat16.

בהרצה מקומית ב־vLLM צריך לשים לב לתלות בטלאי ייעודי לעיגון משקולות הפלט, אחרת השרת מייצר שכבה כפולה שצורכת זיכרון מיותר. אם מדובר בעיבוד של מסמכים בודדים מדי פעם, פנייה לשירות ענן עשויה לחסוך את תחזוקת השרת והתלויות, אבל לעיבוד שוטף בנפח גבוה הרצה עצמית על חומרת אנבידיה תהיה מהירה וזולה יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/NVIDIA-Nemotron-Parse-2.0")
print(pipe("שלום"))

הרישיון

המודל וההגדרות מופצים תחת רישיון OpenMDW-1.1, והטוקנייזר מורשה תחת CC-BY-4.0. הרישיון מתיר שימוש מסחרי ולא מסחרי, כך שניתן לשלב אותו במוצרים פעילים, אך יש לוודא עמידה בתנאי הרישיון של פרויקטים נוספים בקוד פתוח שהספריות מתקינות בעת הריצה.

הרישיון המלא בעמוד המודל ↗