GPT
M

MonkeyOCR

קוד פתוח

echo840רישיון לא דווח2025-06-05

  • monkeyocr
  • safetensors
  • OCR
  • image-text-to-text
  • zh

מודל פיענוח מסמכים שמשלב זיהוי מבנה וקריאת תוכן. הוא מוציא פלט מרקדאון מסודר מטבלאות ונוסחאות מורכבות בלי להריץ מודל ענק.

  • 7.9 GBמשקל הקבצים
  • 335הורדות בחודש
  • 516לייקים

מה זה

הפרויקט בנוי סביב ארכיטקטורת שלשות של מבנה, זיהוי וקשרים, שמפרקת דף לרכיבים במקום לזרוק תמונה שלמה לתוך מודל שפה עיוור. הוא מקבל קובצי PDF או תמונות ופולט שלושה דברים: קובץ מרקדאון של הטקסט והנוסחאות, מסמך שמציג את שכבת המבנה המזוהה, וקובץ JSON עם קואורדינטות מדויקות והקשרים בין הבלוקים השונים בדף.

במדד OmniDocBench המודל מציג תוצאות עריכה נמוכות משמעותית ביחס לחלופות, כלומר פחות שגיאות בהמרה. בטקסט אנגלי הוא עומד על ציון שגיאה של 0.046 בספרים ו־0.024 במאמרים אקדמיים, תוצאה שעוקפת כלים כמו MinerU וגם מודלים רב־מודאליים גדולים. בטבלאות הוא משיג ציון TEDS של 80.2 באנגלית ו־77.7 בסינית, מה שמעיד על שמירה טובה של מבנה השורות והעמודות לעומת ספריות OCR מסורתיות.

מתאים ל

  • המרת מאמרים מדעיים

    מחלץ נוסחאות וטקסט בדיוק גבוה ומייצר קובצי מרקדאון נקיים למאגרי ידע.

  • חילוץ נתונים מדוחות כספיים

    מזהה מבנה עמודות ושומר על יחסי תאים בטבלאות סבוכות לתוך JSON מובנה.

  • עיבוד מסמכים אופליין

    מאפשר הרצה מקומית מלאה על גבי שרת ארגוני ללא דליפת מידע החוצה.

איפה זה נופל

הנקודה החלשה ביותר נחשפת בכתב יד ופתקים. במבחן על Notes ציון השגיאה שלו מזנק ל־0.643, מה שאומר שהוא כמעט עיוור לחלוטין לטקסט שאינו מודפס בדפוס רגיל. בעיתונים הוא מקבל ציון שגיאה של 0.131, וזה מעיד על קושי מסוים בפריסות עמודות מורכבות וצפופות מאוד.

המודל אומן רק על אנגלית וסינית, ואין לו תמיכה רשמית בעברית. אל תבנו עליו למסמכים בעברית או לזיהוי כיווניות מימין לשמאל. בנוסף, מי שמשתמש בכרטיסי מסך ישנים יותר עלול להיתקל בקריסות זיכרון בלי שינויי קונפיגורציה ייעודיים.

שאלות
נפוצות

האם המודל תומך במסמכים בעברית?

המודל מוגדר רשמית לאנגלית ולסינית בלבד. הוא לא אומן על עברית ואינו מזהה קריאה מימין לשמאל, ולכן אינו מתאים לטקסט מקומי.

האם אפשר להריץ אותו על מחשב אישי רגיל?

אפשר להריץ אותו אם יש לכם כרטיס מסך של אנבידיה עם 8 גיגה זיכרון וידאו ומעלה, בעיקר באמצעות שימוש בגרסה מכווצת.

איך מריצים

המשקל הכולל יושב על 7.9 גיגה־בייט ב־24 קבצים. אפשר להריץ אותו דרך ספריית monkeyocr המקומית, בסקריפט פייתון או כקונטיינר דוקר שכולל שרת FastAPI וממשק Gradio. אם יש לכם כרטיס סדרה 20, 30 או 40 של אנבידיה, תצטרכו לבנות את גרסת monkeyocr-fix בדוקר בגלל בעיית זיכרון משותף ב־LMDeploy.

בבדיקות המפתחים, כרטיס RTX 4090 מריץ דפים בקצב של בערך עמוד לשנייה בפיענוח מלא, וב־RTX 3090 הקצב יורד לכחצי עמוד בשנייה. גרסאות מכווצות בקוונטיזציית AWQ מסוגלות לרוץ גם על כרטיסים צנועים עם 8 גיגה זיכרון כמו RTX 4060. אם אין לכם חומרה ייעודית מקומית עם לפחות 8 עד 12 גיגה זיכרון פנוי, עדיף להשתמש ב־API חיצוני.

pip install -U huggingface_hub
hf download echo840/MonkeyOCR

הרישיון

בעמוד המודל לא דווח רישיון רשמי, אף שבמאגר הקוד מוזכר תג Apache 2.0. היעדר רישיון מוגדר בקובצי המודל עצמם יוצר סיכון משפטי, ולכן לא מומלץ לשלב אותו במוצר מסחרי לפני שמקבלים אישור ברור מהיוצרים.

הרישיון המלא בעמוד המודל ↗