GPT
O

olmOCR-bench

קוד פתוח

allenaiodc-by2025-03-14

  • text

מאגר מבחן שמיועד לבדוק איך מודלים ממירים קובצי PDF מורכבים לפורמט מרקדאון. הוא כולל 1,403 מסמכים ובודק תכונות קריטיות כמו סדר קריאה, טבלאות, מתמטיקה וניקוי כותרות עליונות ותחתונות.

  • 58,081הורדות בחודש
  • 285לייקים

מה זה

הרשומות במאגר מייצגות מקרי מבחן להערכת איכות חילוץ טקסט מקובצי PDF. הבדיקות נחלקות לשבע קטגוריות עיקריות שמגיעות ממקורות שונים. קטגוריית מאמרי המתמטיקה מבוססת על 522 מסמכים ממאגר arXiv עם חילוץ מבוסס תכנות דינמי. תחום הטבלאות כולל 188 מסמכים שנלקחו ממאגר פנימי וסומנו באמצעות gemini-flash-2.0. קטגוריית סדר הקריאה בעמודות מרובות נשענת על 231 מסמכים שחולצו בעזרת claude-sonnet-3.7 ורינדור HTML.

סריקות ישנות הגיעו מספריית הקונגרס ומארכיב האינטרנט, ועברו שילוב של כללים ידניים וסקריפטים. ניקוי כותרות עליונות ותחתונות מבוסס על מודל DocLayout-YOLO לצד gemini-flash-2.0. סך הכל ישנם 7,010 מבחני יחידה שמחולקים לחמש תכונות נבדקות, כאשר הבדיקות למשוואות מתמטיות מהוות את החלק הגדול ביותר עם 3,385 בדיקות, לצד בדיקות נוכחות טקסט, היעדר טקסט לא רצוי, סדר קריאה טבעי ומבנה תאי טבלה.

מתאים ל

  • הערכת מודלי OCR למרקדאון

    מדידת הדיוק של מודלים בהמרת מסמכי PDF מורכבים לטקסט מעוצב, בדגש על מיקום נכון של פסקאות וכותרות.

  • בדיקת שחזור משוואות וטבלאות

    בחינה מדויקת של יכולת המערכת לשמור על מבנה תאים תקין בטבלאות ועל יחסי סימנים בנוסחאות מתמטיות.

  • אימות סינון כותרות עמוד

    בדיקה שמספרי עמודים, כותרות עליונות ותחתיות נמחקים מהפלט הסופי ולא נדחפים לתוך רצף הקריאה.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, ואין בו שום ייצוג לטקסט בעברית או לשפות שנכתבות מימין לשמאל. בנוסף, הוא נבנה ככלי מדידה והערכה בלבד, עם 1,403 מסמכים, ולכן הוא קטן מכדי לשמש לאימון מודלים בפועל. חלק ניכר מנתוני הייחוס הופק באמצעות מודלים כמו Gemini ו־Claude, כך ששגיאות מובנות של אותם מודלים עלולות לזלוג למבחנים עצמם. לא הייתי משלב מערכת במוצר שמיועד לקריאת מסמכים ישנים בעברית על סמך ציונים במאגר הזה בלבד.

שאלות
נפוצות

האם יש במאגר תמיכה בטקסט בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד וכולו מבוסס על מסמכים באנגלית ממקורות כמו ספריית הקונגרס ו־arXiv. מי שצריך לבדוק ביצועי OCR על טקסט בעברית, כולל בעיות כיווניות של ימין-שמאל, יצטרך לחפש או לבנות מבחן אחר לגמרי.

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, רישיון ODC-BY-1.0 מתיר שימוש מסחרי ומאפשר גם שינויים בנתונים. הדרישה העיקרית היא מתן ייחוס מתאים למפרסמים ב־allenai. כדאי לשים לב שהיוצרים מציינים שהשימוש מיועד למחקר ולחינוך בהתאם להנחיות השימוש האחראי שלהם.

מה בדיוק נבדק בתוך 7,010 מבחני היחידה?

המבחנים מתמקדים בחמישה מדדים טכניים מוגדרים: נוכחות של מקטעי טקסט ספציפיים, היעדר רכיבים כמו כותרות תחתונות, סדר קריאה נכון בעמודות, שמירה על יחסי שכנות בטבלאות, ומיקום נכון של סימנים בתוך משוואות מתמטיות. כל מבחן מופעל ישירות מול פלט המרקדאון שהמודל פלט.

איך נוצרו תוויות האמת של המבחנים?

התוויות נאספו בכמה שיטות שונות בהתאם לסוג המסמך. בחלק מהקטגוריות השתמשו במודלי שפה כמו gemini-flash-2.0 ו־claude-sonnet-3.7 כדי לייצר את המבנה. בקטגוריות אחרות נעזרו באלגוריתמים לתכנות דינמי, מודלי זיהוי כמו DocLayout-YOLO, או חוקים ידניים שנכתבו עבור סריקות ישנות.

איך טוענים

הקבצים מאורגנים בתיקיית bench_data ומחולקים לפי נושאים בקובצי jsonl נפרדים, כגון arxiv_math.jsonl, headers_footers.jsonl ו־multi_column.jsonl. אין צורך באישור גישה מיוחד כדי להוריד את המאגר מ־Hugging Face. כל רשומה כוללת את מזהי המסמך ואת בדיקות היחידה הספציפיות, שמגדירות אילו מחרוזות צריכות להופיע, מה צריך להישמט, ואילו יחסים גיאומטריים או יחסי שכנות בטבלה נדרשים כדי לעבור את המבחן בהצלחה.

from datasets import load_dataset

ds = load_dataset("allenai/olmOCR-bench")

הרישיון

המאגר מופץ תחת רישיון ODC-BY-1.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שאתם נותנים קרדיט מלא ומציינים את המקור. אין כאן דרישה לשתף נגזרות תחת אותו רישיון. מאחר שמדובר במאגר הערכה ולא בדאטהסט אימון, שאלת המשקל שלו על תוצרי מודלים מאומנים פחות רלוונטית בפועל.

הרישיון המלא ב־Hugging Face ↗