GPT
P

Post-OCR-Correction

קוד פתוח

PleIAscc0-1.02024-04-15

  • ocr
  • synthetic

מאגר שמציג טקסטים היסטוריים סרוקים לצד תיקוני שגיאות סריקה שבוצעו במודל שפה. הוא מיועד למי שמפתח מודלים לניקוי טקסטים משובשים או חוקר עיתונות וספרות ישנה בארבע שפות אירופיות.

  • 1,765הורדות בחודש
  • 135לייקים

מה זה

המאגר מכיל מיליארד מילים של טקסטים היסטוריים שנלקחו מתוך Common Corpus, אוסף גדול לאימון מודלים שפרסם הארגון בעבר. החומרים מורכבים מזוגות של טקסט מקור שכולל שגיאות זיהוי תווים אופטי ברמות חומרה שונות, לצד פלט של תיקון אוטומטי שבוצע באמצעות מודל שפה ומשאבי מחשוב של Jean-Zay. לא מדובר בתיקון אנושי אלא בניסוי חישובי שמטרתו לשפר את איכות הטקסט הגולמי.

התוכן מחולק לפי שפות ומקורות היסטוריים. החלק הצרפתי כולל 438,034,960 מילים מעיתונות היסטורית שמקורה בספרייה הלאומית של צרפת, Gallica. החלק האנגלי מקיף 300,522,681 מילים מתוך פרויקט העיתונות Chronicling America. שאר המאגר מורכב ממונוגרפיות וספרים, עם 144,441,539 מילים באיטלקית ו־97,396,147 מילים בגרמנית, שנאספו ממקורות שונים ובראשם Internet Archive.

מתאים ל

  • אימון מודלים לתיקון סריקה

    אימון מודלי שפה על זוגות של טקסט סרוק ומשובש מול הגרסה המתוקנת שלו.

  • סיווג טקסטים ישנים

    שיפור זיהוי נושאים וסוגות בעיתונות היסטורית באמצעות מילים מתוקנות.

  • עזרה בניקוי ידני

    הצעת תיקונים ראשוניים לפרויקטים שדורשים דיוק אנושי גבוה כמו ויקיטקסט.

  • זיהוי כפילויות במאגרים

    השוואה בין עותקים שונים של טקסטים היסטוריים לאחר ניקוי שגיאות הסריקה.

איפה זה נופל

התיקונים בוצעו על ידי מודל שפה הסתברותי ולא בידי אדם. הכרטיס מציין במפורש שהמודל עלול להמציא מילים שלא הופיעו במקור, במיוחד כשרמת הסריקה נמוכה, או להשמיט קטעים שלמים מהטקסט. המאגר מכסה רק ארבע שפות אירופיות, ללא עברית כלל, ומתבסס על טקסטים ישנים בלבד כמו עיתונות מסוף המאה ה־19, כך שהוא לא מייצג שפה מודרנית או סריקות משרדיות עכשוויות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר פורסם תחת רישיון cc0-1.0 שמוותר על זכויות היוצרים ומעביר אותו לנחלת הכלל. אפשר לאמן עליו מודלים מסחריים בלי צורך באישור ובלי חובת מתן קרדיט.

האם המאגר כולל טקסטים בעברית?

לא. המאגר מכיל אך ורק ארבע שפות: צרפתית, אנגלית, איטלקית וגרמנית. אין בו חומרים בעברית או באלפבית שאינו לטיני.

איך נאספו ותוקנו הטקסטים?

הטקסטים נלקחו מתוך Common Corpus, מאגר פתוח של סריקות מספריות וארכיונים כמו Gallica ו־Internet Archive. התיקונים נוצרו בצורה אוטומטית באמצעות מודל שפה שהורץ על משאבי מחשוב של GENCI-IDRIS בצרפת.

האם התיקונים בדאטהסט אמינים לחלוטין?

לא. מפתחי המאגר מבהירים שמדובר בתיקון הסתברותי של מודל שפה. במקרים של סריקה באיכות גרועה, המודל עשוי להזות מילים שלא היו בטקסט המקורי או להחסיר מידע.

איך טוענים

הנתונים מחולקים ל־45 קבצים בפורמט Parquet, כך שאפשר לטעון אותם בקלות בספריות עיבוד נתונים סטנדרטיות. שמות הקבצים מעידים על המקורות, כמו קובצי gallica_presse לצרפתית או laceflower. אין צורך באישור גישה מיוחד כדי להוריד את המידע. העבודה דורשת התמודדות עם עמודות טקסט המקור מול הטקסט המתוקן בהיקף כולל של מיליארד מילים.

from datasets import load_dataset

ds = load_dataset("PleIAs/Post-OCR-Correction")

הרישיון

המאגר משוחרר ברישיון cc0-1.0 לנחלת הכלל. הרישיון מתיר שימוש מסחרי ומחקרי מלא בלי חובת ייחוס ובלי דרישה לשתף תוצרי המשך תחת אותו רישיון, ומאפשר לאמן עליו מודלים באופן חופשי.

הרישיון המלא ב־Hugging Face ↗