GPT
N

nemotron-ocr-v1

קוד פתוח

nvidiaother2025-10-21

  • image
  • ocr
  • object recognition
  • text recognition
  • layout analysis

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הכלי מפענח טקסט מתמונות ומסמכים תוך שמירה על סדר קריאה ומבנה. הוא מיועד למי שרוצה חילוץ מהיר באנגלית ומעדיף לא להסתבך עם ענקי ראייה כבדים.

  • 202 MBמשקל הקבצים
  • 141הורדות בחודש
  • 121לייקים

מה זה

מדובר במודל OCR היברידי שמחולק לשלושה חלקים נפרדים. יש לו מזהה מיקום מבוסס RegNetY-8GF עם 45,268,472 פרמטרים, מודול זיהוי טקסט מבוסס שנאי עם 4,944,346 פרמטרים, ומודל יחסים עם 2,254,422 פרמטרים שאחראי להבין את מבנה הדף. בסך הכול יש כאן 52,467,240 פרמטרים. התפקיד שלו הוא לקחת תמונה, למצוא איפה כתוב, להמיר את זה למחרוזות ולהחזיר קואורדינטות של תיבות חוסמות יחד עם ציוני ביטחון.

במבחנים מול PaddleOCR הוא מציג שגיאת תווים של 0.1633 לעומת 0.2029, ושגיאת מילים של 0.1203 מול 0.2748. המשמעות בפועל היא שהוא קורא מילים ברצף מדויק יותר מטקסט חופשי. מנגד, בחילוץ טבלאות לפי מדד TEDS שני המודלים עומדים בדיוק על 0.781, כלומר הוא לא נותן יתרון במבנה פנימי של טבלאות.

מתאים ל

  • צינורות RAG למסמכים

    חילוץ פסקאות ובלוקים של טקסט מסריקות של קובצי PDF עבור מנועי חיפוש פנימיים באנגלית.

  • זיהוי שלטים בתמונות

    קריאת טקסט באנגלית מתוך תמונות שצולמו בשטח ומכילות רקעים מורכבים.

  • סריקת קבלות ומסמכי חשבון

    זיהוי שדות ומבנה כללי בקבלות באנגלית תוך שימוש במודל היחסים להבנת סדר התוכן.

איפה זה נופל

המגבלה הכי משמעותית היא שהמודל תומך באנגלית בלבד. אם יש לכם מסמכים בעברית או תמונות עם טקסט משולב, הוא פשוט לא מיועד לזה. בנוסף, הכרטיס מודה מפורשות שהוא מתקשה ועלול לטעות באיכות תמונה ירודה או בגופנים מסוגננים במיוחד, ובחילוץ טבלאות הוא לא מציג שום שיפור לעומת חלופות קודמות.

אותה משפחה

nemotron-ocr יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מזהה עברית?

לא. המודל הוגדר ונבדק באנגלית בלבד, ואינו תומך בשפות אחרות בגרסה זו.

האם אפשר להריץ אותו על מעבד בלבד?

הוא נבנה ומותאם להרצה על כרטיסי מסך של NVIDIA ודורש ספריות CUDA 12.8, כך שהרצה על מעבד אינה נתמכת.

איך מריצים

בשביל להריץ אותו מקומית צריך מערכת הפעלה Linux בארכיטקטורת amd64, כרטיס מסך של NVIDIA וערכת CUDA 12.8. בנוסף נדרשת סביבת Python 3.12 ומהדר C++17 עם תמיכה ב־OpenMP כדי לבנות הרחבות ייעודיות.

אם אין לכם כוח להגדיר ספריות הידור ודרייברים ידנית, NVIDIA מספקת קובץ Docker שרץ ישירות על גבי קונטיינר מוכן. למי שאין לו כרטיס גרפי מתאים בשרת, המודל זמין גם כשירות מנוהל תחת NVIDIA NIM.

pip install -U huggingface_hub
hf download nvidia/nemotron-ocr-v1

הקבצים

137 קבצים במאגר, 202 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון NVIDIA Open Model License Agreement, בעוד שסקריפטי העיבוד משוחררים תחת Apache 2.0. מותר להשתמש בו במוצרים מסחריים, אך השימוש כפוף לתנאים ולהגבלות הספציפיים שהוגדרו בהסכם של אנבידיה.

הרישיון המלא בעמוד המודל ↗