GPT
R

Real5-OmniDocBench

קוד פתוח

PaddlePaddleapache-2.02026-01-26

  • ocr
  • document-parsing
  • benchmark
  • multimodal
  • document

המאגר מכיל 6,775 צילומים פיזיים של אותם מסמכים בדיוק תחת עיוותים, תאורה וצילום מסכים. הוא מיועד לבדיקה קפדנית של מודלי פענוח מסמכים מול הפרעות אופטיות מהעולם האמיתי.

  • 9,541הורדות בחודש
  • 37לייקים

מה זה

בבסיס המאגר עומדים בדיוק 1,355 עמודים שנלקחו מתוך OmniDocBench בגרסה 1.5. צוות הפרויקט לקח את אותם מסמכים בדיוק ושחזר אותם פיזית בחמישה תנאי צילום שונים לחלוטין, מה שמייצר חלוקה שווה של 1,355 תמונות לכל מצב.

למעט מצב הסריקה הרגיל שנעשה במכשיר ייעודי, כל שאר התמונות צולמו ידנית במכשירי מובייל. התנאים כוללים צילום מסמכים מעוקלים ומקופלים, צילום מסכים שמוסיף השתקפויות ועיוותי מוארה, צילום תחת תאורה קשה וצללים, וצילום מזוויות אלכסוניות חדות. ההתאמה הישירה של עמוד מול עמוד מאפשרת לבודד לגמרי את השפעת העיוות הפיזי על התוצאות.

מתאים ל

  • בנצ'מרק לחוסן של OCR

    בדיקת דיוק של מודלי שפה חזותיים מול צילומי טלפון עקומים ומסמכים מקופלים.

  • מדידת עמידות לצילום מסך

    הערכת היכולת של מודלים לחלץ טבלאות ונוסחאות מתוך תמונות מסך עם השתקפויות.

  • ניתוח השפעות תאורה וזווית

    בידוד נקודות השבירה של מערכות חילוץ מידע בעת התמודדות עם צללים חריפים ופרספקטיבה.

איפה זה נופל

המאגר מוגבל אך ורק לטקסטים באנגלית ובסינית, ללא תמיכה בשפות אחרות או בעברית. בנוסף, חסרות בו לחלוטין תוויות הנתונים המקוריות בתוך הריפו עצמו, מה שמאלץ תלות במאגר חיצוני כדי לבצע כל בדיקה או חישוב מדדים. הוא גם לא מתאים לאימון מודלים מאפס בגלל גודלו המצומצם, אלא מיועד כמעט לחלוטין כמבחן ביצועים והערכה.

שאלות
נפוצות

האם הדאטהסט כולל טקסט בעברית?

לא. הנתונים מתמקדים אך ורק בשפות אנגלית וסינית, בהתאם לדפי המקור שנלקחו מתוך OmniDocBench.

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן, הרישיון המוגדר הוא apache 2.0 שמתיר שימוש מסחרי, בכפוף למתן קרדיט ושמירה על תנאי הרישיון. כדאי לזכור שקובץ התוויות מגיע ממאגר נפרד ויש לבדוק גם את תנאי המקור שלו.

כמה מקום נדרש כדי להוריד את הקבצים?

כלל התמונות תופסות בערך 16 גיגהבייט על הדיסק. אם מעוניינים לבדוק תרחיש ספציפי, למשל רק מסמכים מקופלים, אפשר להוריד תיקייה בודדת באמצעות סינון קבצים.

איפה נמצאות התשובות והטקסט האמיתי של התמונות?

המאגר עצמו מכיל תמונות בלבד. את קובץ התוויות והטקסט הנכון מורידים בנפרד ממאגר OmniDocBench של opendatalab לפי גרסה 1.5.

איך טוענים

מורידים את התיקיות ישירות ממאגר הנתונים באמצעות huggingface_hub, כאשר הנפח הכולל עומד על סביב 16 גיגהבייט של קובצי תמונה בפורמט PNG. אין צורך באישור גישה מיוחד. המאגר מכיל רק את קובצי התמונה המחולקים לפי חמש התיקיות, ללא התוויות עצמן. כדי להריץ הערכה, חובה להוריד בנפרד את קובץ הנתונים OmniDocBench.json מגרסה 1.5 של opendatalab ולהתאים כל תמונה לתגית המקורית שלה לפי שמות הקבצים.

from datasets import load_dataset

ds = load_dataset("PaddlePaddle/Real5-OmniDocBench")

הרישיון

המאגר מופץ תחת רישיון apache 2.0 המאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה. נדרש לשמור על הודעות זכויות היוצרים והרישיון המקורי, אך אין חובה לשתף פיתוחים עתידיים תחת אותו רישיון בדיוק. אימון או הערכה של מודל על הנתונים אינם כובלים את תוצרי המודל מעבר לתנאי הייחוס הבסיסיים, אך יש לשים לב שהתוויות נמשכות ממאגר חיצוני.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗