GPT
I

IAM-line

קוד פתוח

Tekliamit2024-01-12

  • atr
  • htr
  • ocr
  • modern
  • handwritten

חיתוכי שורות מתוך מאגר כתב היד הידוע באנגלית, שמיועדים לפיתוח מודלים של זיהוי טקסט מתמונה. המבנה הפשוט חוסך את הצורך לחתוך לבד טפסים מלאים ומאפשר לגשת ישר לאימון.

  • 2,424הורדות בחודש
  • 32לייקים

מה זה

המאגר כולל תמונות של שורות בודדות הכתובות בכתב יד באנגלית, לצד התמלול המדויק שלהן. המקור הוא מאגר IAM הוותיק, שמבוסס על טפסים מלאים שכותבים שונים מילאו. Teklia לקחו את החומר הזה, חתכו אותו לרמת השורה והמירו אותו לפורמט מודרני שמתאים לעבודה ישירה בהאגינג פייס.

העיבוד הטכני כאן כולל התאמה של כל התמונות לגובה אחיד של 128 פיקסלים, בעוד הרוחב משתנה בהתאם לאורך השורה המקורית שנכתבה. המאגר מחולק לשלושה קבצים סטנדרטיים של אימון, ולידציה ובדיקה, כך שאין צורך לבצע חלוקה ידנית לפני שמתחילים להריץ ניסויים.

כל דגימה מכילה רק שני שדות, תמונת השורה והטקסט שנכתב בה. המטרה של המבנה הזה היא לתת נקודת מוצא פשוטה לפיתוח מערכות זיהוי כתב יד, בלי להתעסק בזיהוי מיקום השורות בדף המלא או בחיתוך מורכב של מסמכים שלמים.

מתאים ל

  • אימון זיהוי כתב יד

    אימון מודלים שמקבלים תמונת שורה בודדת ופולטים את הטקסט הכתוב בה באנגלית.

  • מבחן ביצועים למודלים

    שימוש בחלוקת המבחן המובנית כדי להשוות ביצועים מול תוצאות מוכרות בספרות המחקרית.

  • זיהוי כותב

    ניתוח מאפייני הכתיבה בשורות השונות לצורך אימות או זיהוי של האדם שכתב את הטקסט.

איפה זה נופל

החומר מכיל אך ורק אנגלית, כך שאין כאן שום תועלת לפיתוח מודלים לכתב יד בעברית. בנוסף, העובדה שכל התמונות הוקטנו או הוגדלו לגובה קבוע של 128 פיקסלים עלולה לפגוע ביחס הגבהים של האותיות ובאיכות הטקסט. אם המוצר שלכם צריך להתמודד עם מסמכים שלמים, תצטרכו מודל נפרד שיחתוך את השורות מהדף.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא, כל המסמכים במאגר נכתבו באנגלית בלבד. אם המטרה שלכם היא פענוח כתב יד בעברית, הנתונים האלה לא יסייעו לכם כלל. תצטרכו לחפש מאגרי כתב יד ייעודיים שנאספו מדוברי עברית.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מסומן תחת רישיון MIT שהוא רישיון פתוח ומתירני מאוד. מותר להשתמש בו לאימון מודלים מסחריים ולשלב אותם באפליקציות סגורות. התנאי המרכזי הוא הכללת תנאי הרישיון המקוריים במסגרת הפצת התוכנה.

במה המאגר הזה שונה ממאגר IAM המקורי?

המאגר המקורי מציע סריקות של טפסים מלאים שדורשים חיתוך ועיבוד מוקדם של הטקסט. כאן קיבלתם את השורות כשהן כבר חתוכות ומוכנות לעבודה, וכולן עברו התאמה לגובה אחיד של 128 פיקסלים. זה חוסך זמן של ניקוי ופירוק דפים אך מגביל אתכם לפורמט שנקבע מראש.

איך מומלץ לגשת לתמונות כדי לא לתקוע את הקוד?

יוצרי המאגר מציינים כי פנייה ישירה לעמודת התמונות כולה טוענת ומפענחת את כל הקבצים לזיכרון בו זמנית. פעולה כזו עלולה להאט משמעותית את הריצה או להקריס את התהליך בגלל צריכת זיכרון עודפת. מומלץ לגשת לכל דגימה לפי האינדקס שלה ורק אז לקרוא את שדה התמונה הספציפי.

איך טוענים

הטעינה מתבצעת ישירות מקובצי פרקט שמחולקים לאימון, בדיקה ואימות, ללא צורך בהרשמה מוקדמת או אישור גישה. המאגר כולל שני שדות בלבד, תמונה ותמלול. מפתחי המאגר מזהירים שפענוח התמונות מתרחש בזמן אמת בעת הגישה לשדה התמונה, ולכן גישה ישירה לכל עמודת התמונות בבת אחת תיצור צוואר בקבוק כבד בזיכרון.

from datasets import load_dataset

ds = load_dataset("Teklia/IAM-line")

הרישיון

המאגר פורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית, ואינו כופה עליכם לחשוף את קוד המודל שתאמנו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗