GPT
O

OvisOCR2 — הדגמה

קוד פתוח

ATH-MaaSapache-2.02026-07-14

  • gradio

הכלי מקבל תמונות ומסמכי PDF וממיר אותם לטקסט מעוצב במבנה Markdown. הוא מיועד למי שצריך לחלץ תוכן מטבלאות מורכבות, נוסחאות מתמטיות או מסמכים סרוקים.

  • 853Mפרמטרים
  • 262,144טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • הורדות בחודש

מה זה

אתם מעלים תמונה או קובץ PDF, והמערכת מחלצת את התוכן תוך שמירה על סדר הקריאה המקורי. הפלט מגיע כטקסט בפורמט Markdown שכולל נוסחאות בתחביר LaTeX, טבלאות מתועדות בקוד HTML וגזירים חזותיים של אזורים גרפיים מתוך המסמך. התוצאה לא נמסרת בבת אחת בסיום אלא זורמת ישירות למסך בזמן אמת ככל שהמודל מייצר אותה.

מאחורי הקלעים רץ המודל ATH-MaaS/OvisOCR2, כשהקוד משתמש במימוש של Qwen3_5ForConditionalGeneration לעיבוד הנתונים. מסמכי PDF מומרים מקומית לתמונות ברזולוציה ייעודית ומעובדים עמוד אחר עמוד. הממשק נפתח כשהוא ריק, אבל כולל חמש דוגמאות מובנות שאפשר לבחון בלחיצה: שתי טבלאות פיננסיות, שני עמודים של כתב יד בסינית ומאמר מחקרי עמוס בנוסחאות מתוך מאגר OmniDocBench.

מתאים ל

  • המרת מאמרים אקדמיים

    חילוץ תוכן שלם ממחקרים כולל נוסחאות מתמטיות מורכבות שמקודדות ישירות ל־LaTeX.

  • חילוץ טבלאות פיננסיות

    קריאת דוחות כספיים וטבלאות נתונים והפיכתם לתחביר HTML ששומר על מבנה העמודות.

  • דיגיטציה של כתב יד

    עיבוד סריקות של טקסטים ידניים והמרתם לטקסט ממוחשב שניתן לחיפוש ולעריכה.

איפה זה נופל

הכלי מוגבל לעיבוד של עד 50 עמודים למסמך PDF יחיד, כך שהוא לא יתאים לספרים שלמים או לתיקים משפטיים ארוכים במיוחד. הריצה מבוצעת אך ורק במצב הבסיס הרגיל, וההדגמה אינה כוללת את המצב המורחב של המודל. בנוסף, מודל השפה הפנימי מבוסס על ארכיטקטורת Qwen והדוגמאות מתמקדות באנגלית ובסינית, לכן כדאי לבדוק היטב מסמכים בעברית כדי לוודא שסדר הקריאה וכיווניות הטקסט לא משתבשים.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

לא, הגישה להדגמה בדפדפן חופשית ואינה דורשת תשלום או הרשמה. היא נתמכת בתשתית ZeroGPU שמוקצית לפי תור וזמינות. יחד עם זאת, יש מגבלות זמן עיבוד לכל הרצה.

כמה עמודים אפשר להעלות בבת אחת?

ברירת המחדל חוסמת עיבוד מעבר ל־50 עמודים בקובץ PDF אחד. המסמך נסרק בקבוצות של עד ארבעה עמודים בכל פעם כדי לא לחרוג מזמן ההקצאה של המעבד הגרפי. מסמכים כבדים יותר יש לפצל מראש.

האם אפשר להריץ את הכלי על מחשב מקומי?

כן, הקוד מכיל הגדרות מלאות להתקנה מקומית באמצעות סביבת קונדה ו־npm. נדרש כרטיס מסך תואם CUDA וניתן להוריד את קובצי המודל ישירות מ־Hugging Face. אפשר גם להפעיל מצב בדיקה מנוון לבחינת הממשק ללא טעינת המודל.

מה קורה אם החיבור מתנתק באמצע מסמך ארוך?

הממשק שומר בדפדפן את כל העמודים שכבר סיימו לעבור עיבוד. ברגע שהחיבור מתחדש, הקוד ממשיך בדיוק מהעמוד הראשון שנעצר. אתם לא מאבדים את התוצאות שכבר הופקו ונמנעים מעיבוד כפול.

איך מריצים

טוענים קובץ או בוחרים באחת הדוגמאות ומתחילים את הריצה בלי צורך בהרשמה. הכלי רץ על גבי חומרת zero-a10g, שמקצה משאבי עיבוד לפי דרישה. העיבוד מחולק לקבוצות של עד ארבעה עמודים בכל בקשת GPU, כשההקצאה מחושבת לפי כמות העמודים בפועל. הדפדפן ממזג את התוצאות בין הריצות, ואם החיבור מתנתק באמצע, הוא מתחבר שוב מהעמוד האחרון שלא הושלם בלי לאבד את מה שכבר עובד.

pip install -U huggingface_hub
hf download ATH-MaaS/OvisOCR2

הרישיון

הקוד והמודל מופצים תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של הקוד והתוצרים. הקבצים שאתם מעלים נשלחים לשרת שבו רץ ממשק ה־Gradio ומעובדים עליו, לכן מומלץ להימנע מהעלאת מסמכים אישיים רגישים לחומרה שיתופית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗