GPT
O

olmOCR-mix-0225

קוד פתוח

allenaiodc-by2025-02-10

מאגר של מאות אלפי עמודי PDF שעברו המרה לטקסט נקי באמצעות מודל ראייה. הוא נבנה במיוחד כדי ללמד מודלים לקרוא מסמכים מורכבים לפי סדר קריאה אנושי והגיוני.

  • 838הורדות בחודש
  • 170לייקים

מה זה

המאגר מכיל 266,135 עמודים שנלקחו מתוך 105,504 מסמכים שונים. המקורות מתחלקים לשניים, קבצים שנסרקו מהרשת הציבורית מתוך מאגר של מעל 240 מיליון מסמכים, וספרים ברשות הרבים מארכיון האינטרנט. מכל מסמך מקור נדגמו באקראי לכל היותר שלושה עמודים בודדים, כדי לשמור על גיוון ולא להציף את המאגר במבנה של מסמך בודד.

רוב החומר מגיע מהרשת, ומדגם מתוכו מראה ששישים אחוזים הם מאמרים אקדמיים. השאר מתחלק בין חוברות מידע, מסמכים משפטיים, טבלאות, דיאגרמות ומצגות. כל רשומה מייצגת עמוד בודד, וכוללת את כתובת המקור ברשת, מספר העמוד, ומבנה נתונים עם הטקסט שחולץ, זיהוי שפה, תיקוני זווית סיבוב, וסימון אם העמוד מכיל טבלה או תרשים.

מתאים ל

  • אימון מודלי ראייה למסמכים

    לימוד מודלים לחלץ טקסט מעמודי PDF מורכבים תוך שמירה על סדר קריאה נכון והתעלמות מרעשים גרפיים.

  • הערכת ביצועי OCR

    בדיקת איכות של מנועי חילוץ טקסט קיימים מול קובצי ההערכה הייעודיים שמגיעים עם המאגר.

  • זיהוי מבנה עמודים

    אימון מסווגים לזיהוי טבלאות, דיאגרמות ועמודים שדורשים סיבוב לפני פענוח הטקסט.

איפה זה נופל

יש כאן הטיה כבדה למסמכים אקדמיים שתופסים את רוב הנפח, כך שאם אתם בונים מערכת לחשבוניות, קבלות או טפסים ממשלתיים, החלוקה הזו לא מייצגת את הצרכים שלכם. מעבר לכך, הטקסט נוצר באמצעות gpt-4o ולא אומת ידנית בידי בני אדם. זה אומר שהזיות, דילוגים על מילים או שגיאות פענוח של המודל נכנסו ישירות לתוך נתוני האימון. הכרטיס לא מציין חלוקה לשפות מלבד קיומו של שדה שפה, ולכן חובה לבדוק את שיעור העמודים בעברית לפני שמסתמכים עליו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של הדאטהסט עצמו דורש רק ייחוס, אבל הטקסט הופק במודל של OpenAI וכפוף לתנאי השימוש שלהם. אם אתם מאמנים מודל שמיועד להתחרות ישירות בשירותים שלהם, יש כאן סיכון משפטי שכדאי לבדוק.

האם המאגר כולל עמודים בעברית?

הכרטיס כולל שדה שמזהה את השפה העיקרית בכל עמוד, אך לא מפרט אילו שפות קיימות ובאיזה היקף. מאחר שרובו מבוסס על מסמכים מהרשת ומאמרים אקדמיים, רוב החומר באנגלית וסביר שהנוכחות של עברית שולית מאוד.

איך נאסף הטקסט והאם הוא מדויק?

הטקסט לא הוקלד בידי בני אדם אלא חולץ בעזרת הרצת עמודי ה־PDF דרך gpt-4o עם הנחיות שנועדו לשמר טקסט דיגיטלי וסדר קריאה טבעי. רמת הדיוק גבוהה בזכות המודל, אך עדיין מדובר בתוצר מכונה שעלול לכלול שגיאות והזיות.

מה מקבלים בהורדה של המאגר?

המאגר כולל קובצי parquet עם המטא-דאטה והטקסט שחולץ, לצד קובצי ארכיון שמכילים את עמודי ה־PDF המקוריים כקבצים בודדים. זה מאפשר לעבוד ישירות על הטקסט או לגשת לקבצים הוויזואליים לאימון מודלי תמונה.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך באישור גישה, והוא כולל 58 קבצים. המידע הטבלאי מחולק לקובצי parquet, כולל קובצי הערכה ייעודיים כמו eval-iabooks ו־eval-s2pdf. עמודי המקור עצמם שמורים כקובצי PDF נפרדים בתוך ארכיונים מכווצים תחת ספריית pdf_tarballs. בעבודה עם הטקסט השדה החשוב ביותר הוא natural_text שנמצא תחת response, שם יושב הפלט המלא. שאר השדות במבנה מאפשרים לסנן עמודים לפי סיבוב או נוכחות של אלמנטים גרפיים.

from datasets import load_dataset

ds = load_dataset("allenai/olmOCR-mix-0225")

הרישיון

המאגר מופץ תחת רישיון ODC-BY 1.0, שדורש מתן קרדיט ליוצרים. המפרסמים מייעדים אותו לצרכי מחקר וחינוך, ומפנים להנחיות השימוש שלהם. נקודה שחובה לקחת בחשבון היא שהטקסטים נוצרו באמצעות GPT-4o, ולכן הם כפופים גם לתנאי השימוש של OpenAI, שמגבילים שימוש בפלט לאימון מודלים שמתחרים בהם ישירות.

הרישיון המלא ב־Hugging Face ↗