GPT
N

nemotron-ocr-v2

קוד פתוח

nvidiaother2026-04-01

  • image
  • ocr
  • object recognition
  • text recognition
  • layout analysis

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

פתרון ראיית מחשב ממוקד לחילוץ טקסט עם חיזוי סדר קריאה. הוא שוקל פחות מגיגהבייט אחד ומגיע לקצב עיבוד חריג של 34 עד 40 עמודים בשנייה.

  • 527 MBמשקל הקבצים
  • 1,369הורדות בחודש
  • 255לייקים

מה זה

מדובר במודל שמפרק את עבודת הזיהוי לשלושה חלקים נפרדים. תחילה רשת קונבולוציה מאתרת את מיקום הטקסט בתמונה, אחריה מודל שפה מבוסס טרנספורמר מתעתק את האותיות, ולבסוף מודל יחסים מארגן את הפסקאות לפי סדר הקריאה ההגיוני שלהן. החלוקה הזו מונעת מהטקסט להישפך כרצף מילים חסר פשר במסמכים מרובי עמודות, טבלאות ותרשימים.

הוא מגיע בשתי תצורות, גרסה ייעודית לאנגלית עם 53,831,335 פרמטרים וגרסה רב־לשונית עם 83,853,044 פרמטרים. במבחני הביצועים של OmniDocBench על כרטיס A100 יחיד, הגרסה הרב־לשונית הציגה קצב של 34.7 עמודים בשנייה. זה מהיר פי 20 ויותר מכלים כמו PaddleOCR ו־OpenOCR שנבדקו מולו, אף שמדד שגיאות העריכה שלו באנגלית מעט גבוה יותר בהשוואה אליהם. במבחני SynthDoG הוא הוביל בבירור על מודלים מתחרים בשפות מזרח אסיה וברוסית.

מתאים ל

  • הכנת מסמכים לצינורות RAG

    הוא קורא 34 עמודים בשנייה ומפיק ישירות סדר קריאה נכון של פסקאות, מה שחוסך שלב עיבוד נוסף בחלוקה לטקסטים.

  • סריקת טפסים ותרשימים

    הוא מחלץ טקסט מתוך תרשימים וטבלאות יחד עם גבולות התיבה ומידת הוודאות של כל מילה.

  • זיהוי אזורי טקסט בלבד

    מצב הרצה ייעודי של שלב הזיהוי בלבד מקצץ 37% בצריכת הזיכרון ופולט רק קואורדינטות של אזורי טקסט.

איפה זה נופל

עברית לא נתמכת כאן בכלל. המודל מכסה רק אנגלית, רוסית, סינית, יפנית וקוריאנית, כך שעבור טקסט ישראלי מקומי אין מה לנסות אותו אפילו. גם במסמכים בשפות הנתמכות, הכרטיס מודה שאיכות התמונה וגופנים מסוגננים מדי פוגעים בדיוק התוצאה. במבחני סיבוב ב־270 מעלות ובטקסטים מעורבים של אנגלית וסינית, מדד שגיאות העריכה שלו קופץ בצורה חדה ומעיד על קושי מהותי בטיפול בטקסט שאינו מיושר כרגיל.

אותה משפחה

nemotron-ocr יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לזיהוי מסמכים בעברית?

לא. המודל אומן ותומך רק באנגלית, סינית, יפנית, קוריאנית ורוסית. הוא יפספס לחלוטין תווים בעברית ולא יחזיר תוצאות שמישות למסמכים מקומיים.

למה שההתקנה המקומית תיכשל למרות שיש לי PyTorch?

החבילה דורשת קומפילציה של תוסף C++ ייעודי בזמן ההתקנה. חייבים התאמה מדויקת בין גרסת ה־CUDA Toolkit המותקנת במערכת ההפעלה לבין גרסת ה־CUDA שעליה נבנה ה־PyTorch שלכם, יחד עם פייתון 3.12.

במה הגרסה הרב־לשונית נבדלת מהגרסה שמיועדת רק לאנגלית?

בגרסה הרב־לשונית מפענח הטקסט עמוק יותר עם שישה שכבות טרנספורמר לעומת שלוש, ואוצר המילים שלו גדל מ־855 תווים ל־14,244 תווים. ההבדל הזה מעלה את משקל המודל מ־53 מיליון פרמטרים ל־83 מיליון.

איך מריצים

ההרצה דורשת סביבת לינוקס, פייתון בגרסה 3.12 בלבד, ומעבד גרפי של אנבידיה מארכיטקטורות Ampere, Lovelace, Hopper או Blackwell. ההתקנה מורכבת מהרגיל, משום שהיא מקמפלת הרחבת C++ ו־CUDA מקומית שחייבת לתאום במדויק את גרסת ה־PyTorch במערכת. לחלופין, אנבידיה מספקת קונטיינר מוכן שחוסך את כאב הראש הזה של הקומפילציה.

בזמן ריצה המודל גמיש מאוד. אם דרוש רק מיקום תיבות הטקסט ללא פענוח התוכן, אפשר לכבות את המפענח וכך לחסוך כ־37% מצריכת זיכרון הווידאו. באותו אופן, ביטול רכיב סדר הקריאה מקצץ כ־35% מזיכרון הווידאו עבור מקרים פשוטים. אם אין לכם חומרת שרת תואמת של אנבידיה או שאתם מחפשים הרצה מהירה מחוץ ללינוקס, תצטרכו להשתמש במיקרו־שירותים דרך Build.Nvidia.com.

pip install -U huggingface_hub
hf download nvidia/nemotron-ocr-v2

הקבצים

140 קבצים במאגר, 527 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר תחת NVIDIA Open Model License Agreement לצד אזכור של Apache 2.0, והוא מוגדר במפורש כמותר לשימוש מסחרי. עם זאת, השימוש כפוף להסכם הייעודי של אנבידיה, מה שאומר שחובה לקרוא את התנאים המשפטיים של ההסכם לפני הטמעה במוצר סופי שמופץ למשתמשים חיצוניים.

הרישיון המלא בעמוד המודל ↗