GPT
N

Nanonets-OCR-s

קוד פתוח

nanonetsרישיון לא דווח2025-06-10

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • OCR

מודל ראייה קומפקטי שממיר מסמכים שלמים למרק-דאון מובנה, כולל זיהוי חתימות, סימני מים ונוסחאות. פתרון מתאים למי שרוצה להזין קבצים מורכבים ישירות לפייפליין של מודלי שפה.

  • 3.8Bפרמטרים
  • 128,000טוקנים בהקשר
  • 7.0 GBמשקל הקבצים
  • 367,437הורדות בחודש

מה זה

במקום לשלוף רצף טקסט שטוח כמו מנועי פענוח ישנים, הדגם הזה מבוסס על ארכיטקטורת Qwen2.5-VL ומייצר פלט סמנטי נקי. הוא מפרק דפים לפורמט מרק-דאון או טבלאות HTML, מתרגם משוואות מתמטיות לכתיב LaTeX עם הבחנה בין משוואה בתוך שורה למשוואה נפרדת, וממיר תיבות סימון לתווי יוניקוד ברורים.

התוספת המשמעותית כאן היא היכולת לבודד אלמנטים ויזואליים שלא שייכים לטקסט הרציף. הוא עוטף חתימות בתגיות ייעודיות, מחלץ טקסט מסימני מים ברקע, ומייצר תיאור מילולי לגרפים, תרשימים ולוגואים בתוך תגיות תמונה, כך שמודל השפה הבא בתור לא יפספס את ההקשר.

מתאים ל

  • הכנת מסמכים למערכות RAG

    הוא מייצר מרק-דאון עם תגיות לתמונות וטבלאות, מה שמספק למודל השפה הבא הקשר עשיר בלי לאבד מבנה.

  • סריקת חוזים ומסמכים משפטיים

    התיוג האוטומטי של חתימות וסימני מים מאפשר לזהות אישורים רשמיים ולבודד אותם משאר התוכן.

  • פענוח מאמרים ודפי נוסחאות

    התרגום הישיר של משוואות מתמטיות לתחביר LaTeX חוסך שחזור ידני של ביטויים מסובכים.

איפה זה נופל

הנתונים הרשמיים מגדירים את הדגם לשפה האנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד מסמכים בעברית לפני בדיקה מעמיקה. חלון ההקשר רחב מאוד, אבל מודלים בגודל של כמעט ארבעה מיליארד פרמטרים עדיין נוטים לפספס פרטים קטנים או להמציא ערכים בטבלאות צפופות ומטושטשות במיוחד. בנוסף, כרטיס המודל לא מציג מבחני ביצועים כמותיים מול פתרונות אחרים, מה שמחייב אתכם למדוד דיוק על הדאטה הספציפי שלכם.

שאלות
נפוצות

האם המודל תומך בפענוח מסמכים בעברית?

התיעוד הרשמי מציין תמיכה באנגלית בלבד. הארכיטקטורה הבסיסית אומנם מכירה שפות נוספות, אך לא מומלץ להסתמך עליו למסמכים עבריים בלי בדיקה של איכות הפלט.

האם אפשר להשתמש במודל בתוך אפליקציה מסחרית?

נכון לעכשיו לא מוגדר רישיון פתוח או מסחרי בדף המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה להפיץ אותו או להשתמש בו במוצר עד לבירור מול היוצרים.

איך הכי מומלץ להריץ אותו בפרודקשן?

יוצרי המודל ממליצים להריץ אותו דרך vLLM לצורך קבלת שרת מהיר שמנצל את הזיכרון ביעילות. אפשרות נוספת שהם מספקים היא שימוש בספריית docext שהם פיתחו לטיפול בפלט מרק-דאון.

איך מריצים

עם משקל קבצים של שבעה גיגה-בייט ודיוק bfloat16, המודל דורש כרטיס מסך מודרני עם לפחות שמונה עד עשרה גיגה זיכרון כדי לרוץ בצורה חלקה. אפשר לטעון אותו ישירות דרך ספריית transformers, אבל אם המטרה היא עיבוד מסמכים בכמויות, עדיף להרים אותו מעל vLLM בעזרת הפקודה המובנית או להשתמש בחבילת docext שהצוות שחרר.

אם אין לכם שרת ייעודי עם מעבד גרפי זמין, או שאתם צריכים לטפל רק בכמה חשבוניות פעם בשבוע, התחזוקה העצמית מיותרת. במקרה כזה שווה לפנות ישירות לפתרון מנוהל ולחסוך את כאב הראש התשתיתי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nanonets/Nanonets-OCR-s")
print(pipe("שלום"))

הרישיון

היוצרים לא ציינו רישיון בעמוד המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שילוב שלו במוצר מסחרי חושף אתכם לסיכון משפטי עד שהחברה תבהיר את התנאים.

הרישיון המלא בעמוד המודל ↗