GPT
O

OvisOCR2

קוד פתוח

ATH-MaaSapache-2.02026-07-13

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • ocr

מודל פיענוח מסמכים קומפקטי שממיר תמונות עמוד ישירות למרקדוואן מלא. הוא שוקל פחות מגיגה וחצי ומיועד למי שרוצה חילוץ טבלאות ונוסחאות בריצה מקומית קלה.

  • 853Mפרמטרים
  • 262,144טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 136,204הורדות בחודש

מה זה

מדובר במודל שפותח על בסיס Qwen3.5 בגודל 0.8 מיליארד פרמטרים ועבר אימון ייעודי הכולל SFT, למידת חיזוק ו־OPD. במקום לפרק את העבודה לשלבים נפרדים של זיהוי בלוקים, OCR ועימוד, הוא לוקח תמונה ומייצר פלט מרקדוואן לפי סדר הקריאה הטבעי של הדף, כולל טקסט, נוסחאות, טבלאות ואזורים ויזואליים.

במדד OmniDocBench גרסה 1.6 הוא הגיע לציון 96.58, והיוצרים מציינים שמדובר במודל הקצה לקצה הראשון שהגיע לראש הטבלה מול מערכות צינור מרובות שלבים. במדד PureDocBench הוא קיבל ציון ממוצע של 75.06, שמעיד על עבודה יציבה בניתוח מסמכים ללא מנועי עזר מסביב.

מתאים ל

  • המרת מאמרים אקדמיים

    שליפת נוסחאות, טבלאות ומבנה עמוד ישירות למרקדוואן נקי בלי צורך במנועי OCR חיצוניים.

  • דיגיטציה של דוחות כספיים

    חילוץ מבנה טבלאות מורכב מדפי מסמך סרוקים ושמירה על סדר קריאה תקין.

  • עיבוד מקומי במכשיר קצה

    גודל קבצים של 1.6 גיגהבייט מאפשר הרצה מהירה גם על חומרה מוגבלת בלי לשלוח מידע החוצה.

איפה זה נופל

למרות האימון המשולב, היוצרים מצהירים במפורש שהמודל עלול לייצר פלט שגוי, טקסט חלקי, חזרות מיותרות או עיוות של מבנה טבלאות ונוסחאות. סדר הקריאה עדיין עלול להשתבש במסמכים מורכבים ולא סטנדרטיים. אין כאן מילה על תמיכה בעברית או יישור מימין לשמאל, ולכן חובה לבדוק מסמכים מקומיים לפני שמסתמכים עליו.

שאלות
נפוצות

האם צריך לחתוך את התמונות והטבלאות לפני שמזינים אותן למודל?

לא. המודל בנוי לפענוח עמוד שלם מקצה לקצה. הוא מזהה לבד את אזורי הוויזואליה, הטבלאות והנוסחאות מתוך תמונת הדף המלאה.

האם המודל שומר על התמונות המקוריות של המסמך?

ברירת המחדל מסננת תגיות תמונה מתוך המרקדוואן. כדי לשמור אותן יש לשנות את ההגדרה בעת הקריאה לפונקציה ולשמור את החיתוכים לצד הקובץ.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.6 גיגהבייט בלבד, כך שלא צריך מפלצת חומרה כדי להריץ אותו. כרטיס גרפי צרכני פשוט או שרת ענן קטן עם מעט זיכרון וידאו יספיקו כדי לעבד דפים במהירות.

ההרצה מתבצעת בעזרת vLLM גרסה 0.22.1 וספריית pillow. כברירת מחדל פונקציית הפענוח מסירה תגיות תמונה, אבל אפשר לבטל את הסינון כדי לשמור את גזרי התמונות לצד קובץ המרקדוואן שנוצר. אם יש לכם מסמך בודד פעם בחודש, שימוש בהדגמה המקוונת בהאגינג פייס פשוט יותר מהקמת סביבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ATH-MaaS/OvisOCR2")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית במוצר שלכם. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗