GPT
M

medieval

קוד פתוח

CATMuScc-by-4.02024-01-27

  • optical-character-recognition
  • humanities
  • handwritten-text-recognition

מאגר נרחב לפענוח כתבי יד מימי הביניים באלפבית לטיני, עם מעל 160 אלף שורות טקסט מתועדות. הוא נבנה כדי ליצור סטנדרט תמלול אחיד שמאפשר לאמן ולהשוות מודלים היסטוריים.

  • 4,454הורדות בחודש
  • 27לייקים

מה זה

המאגר כולל מעל 160,000 שורות טקסט ומעל חמישה מיליון תווים, שנאספו מיותר ממאתיים כתבי יד ודפוסי ערש שנוצרו בין המאה השמינית למאה ה־16. החומרים מקורם באוספים מוסדיים שונים, ביניהם ספריית צרפת הלאומית וספריית סנטה קרוז בווליאדוליד, בתמיכת גופים כמו BnF Datalab ו־Biblissima. עשרות חוקרים ומומחים לקחו חלק בתמלול לפי שיטה אחידה שנועדה לחבר בין פרויקטים שונים.

הנתונים מיועדים למשימות תמונה לטקסט וכוללים מטא-דאטה היסטורי עשיר. בין השאר מתועדים המאה שבה נוצר המסמך, השפה, הסוגה וסגנון הכתב. הטקסטים מכסים שפות היסטוריות שונות באלפבית לטיני, כולל צרפתית עתיקה וביניימית, הולנדית ביניימית, ספרדית, קטלאנית, איטלקית, ונציאנית, נווארית, אנגלית עתיקה ולטינית.

מתאים ל

  • זיהוי כתב יד היסטורי

    אימון מודלי ראייה ממוחשבת לפענוח שורות טקסט באלפבית לטיני מתוך כתבי יד עתיקים.

  • סיווג סגנונות כתב

    זיהוי אוטומטי של סוגי פונטים היסטוריים וסגנונות כתיבה בספרים שנכתבו בין המאות ה־8 ל־16.

  • תיארוך מסמכים

    הערכת תקופת היצירה של כתבי יד ודפוסי ערש לפי מאפייני התמונה והמטא-דאטה של המאות.

איפה זה נופל

יש במאגר הטיה חזקה לטובת צרפתית עתיקה, הולנדית ביניימית וספרדית, ובעיקר לטקסטים מהמאה ה־14. לטינית היא השפה היחידה שמכוסה בכל המאות ובכל סגנונות הכתב, כשרק צרפתית עתיקה מתקרבת לרמת הכיסוי הזו. שפות אחרות סובלות ממיעוט חומר, למשל אנגלית עתיקה שמיוצגת במסמך בודד בלבד. עברית או שפות שאינן באלפבית לטיני לא קיימות כאן בכלל, והיוצרים מציינים שהמאגר לא מתאים למשימות של ייצור תמונה מטקסט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים למוצרים סגורים. התנאי היחיד הוא מתן קרדיט ברור ליוצרי המאגר בהתאם לדרישות הרישיון.

האם יש במאגר כתבי יד בעברית?

לא. המאגר מוגבל למסמכים באלפבית לטיני בלבד ומכיל שפות אירופיות היסטוריות כמו לטינית, צרפתית עתיקה וספרדית. אין בו שום ייצוג לכתבי יד עבריים או לכתב עברי.

איך המידע מאורגן בתוך הקבצים?

הנתונים מחולקים ל־350 קבצי parquet לפי כתבי יד וקטעים. בכל רשומה יש תמונה של שורת טקסט בעמודה im, את התמלול שלה בעמודה text, ועמודת gen_split לחלוקה קבועה בין אימון לבדיקה.

האם המאגר מאוזן בין התקופות והשפות השונות?

ממש לא. יש בו הטיה ברורה למאה ה־14 ולשפות מסוימות כמו צרפתית עתיקה, הולנדית ביניימית וספרדית. לטינית היא השפה היחידה שכוללת דוגמאות מכל המאות ומכל סגנונות הכתב, בעוד אנגלית עתיקה כוללת מסמך אחד בלבד.

איך טוענים

טוענים את המאגר ישירות בעזרת הפקודה load_dataset("CATMuS/medieval") בספריית datasets הרגילה. המידע מחולק ל־350 קבצים בפורמט parquet לפי כתבי היד השונים, ואין צורך בהרשאה מיוחדת כדי לגשת אליהם. כל שורה מכילה עמודת תמונה בשם im ועמודת תמלול בשם text. בנוסף ישנה עמודת gen_split שמאפשרת חלוקה מוגדרת מראש של 90 אחוז לאימון, 5 אחוז לוולידציה ו־5 אחוז לבדיקה ברמת כתב היד.

from datasets import load_dataset

ds = load_dataset("CATMuS/medieval")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, כל עוד ניתן קרדיט מתאים ליוצרים ומצוין הקישור לרישיון. אין דרישה לשתף נגזרות באותו רישיון, כך שמותר לאמן עליו מודלים פנימיים או מסחריים בלי לחשוף את הקוד או את המשקולות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗