GPT
O

OCR-Synthetic-Multilingual-v1

קוד פתוח

nvidiacc-by-4.02026-04-08

  • ocr
  • text-detection
  • text-recognition
  • synthetic-data
  • synthdog

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר מסמכים סינתטיים בקנה מידה של מיליוני דוגמאות לחמש שפות עיקריות. אנבידיה בנו אותו עם תיוגים מלאים ברמת מילה, שורה וסדר קריאה כדי לאמן מודלי זיהוי טקסט.

  • 11,036הורדות בחודש
  • 51לייקים

מה זה

המאגר מכיל 12,258,146 רשומות המחולקות לפי שפות: אנגלית, יפנית, קוריאנית, רוסית, וסינית בשתי צורות כתיב, מפושטת ומסורתית. כל שפה כוללת חלוקה מוגדרת מראש לאימון, בדיקה ותיקוף, כאשר אימון מחזיק ברוב המוחלט עם 9,845,642 דוגמאות. הנתונים לא נסרקו ממסמכים קיימים בעולם הפיזי אלא יוצרו באמצעות גרסה מותאמת ומורחבת של מנוע SynthDoG מפרויקט Donut.

כל רשומה מורכבת מתמונת JPEG שמקודדת בבתים, ממדי התמונה המקוריים, מחרוזת טקסט מלאה של העמוד, ומבנה JSON עשיר שמפרט תיחומים הנדסיים. התיוג יורד לרמת תיבות מילים, שורות טקסט, פסקאות מלאות, ומבנה גרף שמגדיר את סדר הקריאה התחבירי של הדף. מאחר שהמידע נוצר בקוד ולא נאסף ידנית, התיוג הוא אוטומטי ומובנה מראש בתהליך הרינדור ללא עבודת סימון אנושית.

מתאים ל

  • אימון מודלי זיהוי טקסט

    לימוד זיהוי אותיות ומילים מורכבות בשפות אסיאתיות, קירילית ואנגלית ישירות מתמונות מסמכים.

  • איתור פסקאות וזיהוי פריסה

    זיהוי תיבות גבול של מילים, שורות ופסקאות באמצעות קואורדינטות הפוליגונים המדויקות שקיימות בנתונים.

  • שחזור סדר קריאה במסמכים

    אימון רכיבים במערכות אחזור מידע שמסדרים טקסט לפי היררכיית קריאה נכונה בעזרת גרף היחסים המובנה.

איפה זה נופל

הנתונים כולם סינתטיים ומיוצרים במחשב. זה אומר שאין כאן לכלוך אמיתי של סריקות משרדיות, קימוטי נייר מורכבים, חותמות דהויות או כתמי קפה שמאפיינים מסמכים פיזיים מהעולם האמיתי, אלא רק אפקטי רינדור שהמנוע תוכנן לייצר. מעבר לזה, הכיסוי הלשוני צר וכולל רק שפות ספציפיות: אנגלית, רוסית, ושלוש שפות ממזרח אסיה. עברית ושפות הנכתבות מימין לשמאל לא קיימות כאן בכלל, כך שלפרויקטים מקומיים בישראל אין לדאטהסט הזה ערך ישיר בלי הוספת דאטה אחר לחלוטין.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא. המאגר מוגבל אך ורק לחמש שפות: אנגלית, יפנית, קוריאנית, רוסית וסינית. אין בו מילים או מסמכים בעברית.

האם מותר להשתמש בו למוצר מסחרי?

כן. הרישיון הוא CC BY 4.0 ואנבידיה מציינת במפורש שהדאטהסט מוכן לשימוש מסחרי. חובתכם היחידה היא לתת קרדיט נאות ליוצרים.

כמה מקום בדיסק צריך כדי להוריד את הכל?

נפח האחסון הכולל של כלל הקבצים מגיע ל־5.45TB. אם אתם צריכים רק שפה אחת, עדיף להוריד רק את התיקייה הרלוונטית שמחולקת לקובצי h5 קטנים יותר.

האם אלו מסמכים אמיתיים שנסרקו?

לא, כל הדוגמאות נוצרו באופן סינתטי ממוחשב בעזרת כלי מבוסס SynthDoG. התיוג מדויק לגמרי כי הוא מופק בזמן יצירת התמונה, אך המראה ממוחשב ולא תמיד תואם סריקות פיזיות.

איך טוענים

המאגר שוקל 5.45TB בסך הכל ומחולק בין 1,263 קובצי HDF5 בפורמט h5. אין כאן תהליך אישור גישה מיוחד, אבל אי אפשר פשוט לפתוח אותו בקוד רגיל בלי לתכנן אחסון וקריאה מקבילית. הקריאה מתבצעת בעזרת ספריית h5py, שבה שולפים את מערך הבתים של התמונות ומפענחים אותם לפורמט פיקסלים, לצד טעינת מחרוזת ה־JSON של התיוגים עם json.loads. המפתחות החיוניים בכל קובץ הם images לתמונות, annotations לפוליגונים ולסדר הקריאה, ו־labels לטקסט המלא.

from datasets import load_dataset

ds = load_dataset("nvidia/OCR-Synthetic-Multilingual-v1")

הרישיון

המאגר זמין תחת רישיון Creative Commons Attribution 4.0, המוכר כ־CC BY 4.0. הרישיון מתיר שימוש מסחרי ומחקרי חופשי, כולל שינוי הנתונים ואימון מודלים פנימיים או ציבוריים. התנאי היחיד הוא מתן קרדיט וייחוס לחברת אנבידיה לפי פרטי הציטוט שפרסמה, ללא חובת שיתוף של התוצרים באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗