GPT
R

rukopys

קוד פתוח

UkrainianCatholicUniversitycc-by-4.02026-04-13

  • handwriting-recognition
  • htr
  • ocr
  • bounding-box
  • ukrainian

מעל עשרת אלפים תמונות של כתב יד באוקראינית, ממסמכים ארכיוניים מ־1919 ועד שיעורי בית מצולמים בנייד. הוא נבנה לזיהוי טקסט, חלוקה לאזורים והפרדה בין כתב יד לדפוס.

  • 6,438הורדות בחודש
  • 22לייקים

מה זה

המאגר מיועד למשימות זיהוי טקסט ומכיל עמודי מסמכים מלאים לצד תמלול ותיחום אזורים בקואורדינטות פיקסלים. הדאטה מגיע מארבעה מקורות שונים בתכלית: תכתיב לאומי שנתי שצולם בטלפונים, סריקות של מסמכי מדינה מארכיון ЦДАВО, מבחנים סרוקים מחמש פקולטות באוניברסיטת KNUTE, ומחברות של תלמידי בית ספר שנלכדו במצלמות נייד.

החלוקה הפנימית מפרידה בין איכות התיוג. חלק האימון מכיל 1,330 תמונות עם תיוג אנושי של מומחים ומתנדבים, וסט המבחן כולל 385 תמונות שמיועדות להערכה. רוב המאגר, 9,020 תמונות, יושב בחלק שנקרא silver, שבו התיוג נוצר אוטומטית באמצעות מודלי שפה ותמונה לצורך אימון חצי מפוקח.

מתאים ל

  • אימון מודלי HTR לאוקראינית

    זיהוי תווים ומילים בכתב יד מגוון, מקליגרפיה היסטורית בדיו ועד שרבוטים מודרניים בעיפרון.

  • פילוח מסמכים מעורבים

    הפרדה בין טקסט מודפס לטקסט ידני על גבי אותו עמוד בטפסים, כותרות ומחברות לימוד.

  • זיהוי נוסחאות מתמטיות

    חילוץ ביטויים מתמטיים וכימיים מתוך פתרונות של תלמידים והמרתם לייצוג LaTeX מדויק.

איפה זה נופל

חלק ה־silver הענק נוצר אוטומטית על ידי מודלים וכולל בעיות ידועות כמו סחיפה בסדר הקריאה בטקסטים צפופים וחיתוך שורות נטויות בגלל שימוש בתיבות תוחמות ישרות. כ־440 קבצים ישנים מהארכיון מכילים תערובת של אוקראינית ורוסית באיות היסטורי מלפני הרפורמות של שנות העשרים. בנוסף, אין כאן מילה בעברית או באנגלית, המאגר מתמקד כולו באוקראינית ודורש התמודדות עם קירילית. לפני שמכניסים לפרודקשן, חובה לסנן את התיוגים האוטומטיים או להשתמש רק בסט האנושי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא באימון ובהערכה. הדרישה החוקית היחידה היא מתן קרדיט ברור ליוצרים. המודל שתאמנו לא חייב להיפתח לציבור.

האם המאגר רלוונטי לזיהוי כתב יד בעברית?

לא. כל הטקסטים במאגר נכתבו באוקראינית באלפבית קירילי, עם מעט רוסית במסמכים ישנים ונוסחאות באנגלית או לטינית. הוא יכול לסייע רק אם אתם בונים ארכיטקטורה כללית לזיהוי תווים ורוצים לבחון עמידות לרעשי מצלמה.

מה ההבדל בין חלק ה־train לחלק ה־silver?

ה־train כולל 1,330 תמונות שתויגו ואומתו ידנית על ידי אנשי מקצוע ומתנדבים. ה־silver מכיל 9,020 תמונות שתויגו אוטומטית באמצעות מודלי ראייה, ולכן הוא רועש יותר ונועד לאימון חצי מפוקח או להתאמת דומיין.

איך נאספו התמונות והאם יש בהן מידע אישי?

התמונות הגיעו מסריקות של מסמכי ארכיון ממשלתיים ומבחנים אקדמיים, לצד צילומי סמארטפון של הכתבות ומחברות תלמידים. כל התמונות עברו בדיקה והסרה של מידע מזהה לפני הפרסום.

איך טוענים

טוענים ישירות דרך ספריית datasets באמצעות הפקודה load_dataset על המזהה UkrainianCatholicUniversity/rukopys. אין צורך באישור גישה מראש. אם רוצים לחסוך מקום ורעש של תיוג אוטומטי, אפשר לטעון רק את split="train". כל רשומה כוללת את התמונה עצמה, גובה ורוחב, מקור הדאטה, ומערך אזורים עם תיבות תוחמות, סוג האזור, שפה, קריאות והתמלול המדויק. נוסחאות מתומללות בפורמט LaTeX וטבלאות מופרדות באמצעות פסיקים או קווים.

from datasets import load_dataset

ds = load_dataset("UkrainianCatholicUniversity/rukopys")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. מותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים ואימון מודלים קנייניים, ואין חובה לשתף נגזרות באותו רישיון. התנאי היחיד הוא מתן ייחוס הולם ליוצרים מהאוניברסיטה הקתולית של אוקראינה. מודל שאומן על הדאטהסט אינו כבול ברישיון פתוח, כל עוד עמדתם בדרישת הייחוס במסמכי המערכת.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗