GPT
N

NayanaOCR_Corpus_2025

קוד פתוח

Cognitive-Labcc-by-nc-4.02026-05-20

  • ocr
  • parallel-corpus
  • multilingual-parallel
  • cross-lingual
  • document-ai

מאגר ענק של מסמכים סינתטיים מקבילים ב־22 שפות שכולל תמונות, תיבות תוחמות ושאלות תשובות. מתאים למי שמאמן מודלי ראייה שפה על מסמכים מורכבים ושפות הודיות.

  • 5,843הורדות בחודש
  • 18לייקים

מה זה

המאגר מכיל מסמכים מרובי שפות שנוצרו במכונה, עם דגש חזק על שפות הודיות לצד שפות נפוצות כמו אנגלית, ערבית, רוסית, גרמנית ויפנית. כל תצורה מוקדשת לשפה בודדת ומכילה בדיוק 45,735 דוגמאות אימון, מה שמעיד על מבנה מקביל לחלוטין שבו אותם מסמכים מיוצרים בכל השפות.

כל רשומה כוללת תמונת מסמך בפורמט JPG, מזהה תמונה, ואת שם הגופן ששימש לעיבוד. בנוסף, ישנו שדה אזורים המפרט תיבות תוחמות ברמת קואורדינטות, סוג העימוד, הטקסט המקורי באנגלית ותרגומו לשפת היעד. לצד אלה מצורף קובץ שאלות ותשובות ויזואליות עם שאלות רב ברירה או שאלות סגורות על תוכן המסמך.

מתאים ל

  • אימון מודלי ראייה שפה

    כוונון מודלים רב לשוניים על משימות הבנת מסמכים ומענה על שאלות מתוך תמונה.

  • זיהוי מבנה ועימוד מסמכים

    אימון מודלים לאיתור תיבות טקסט וסיווג מקטעים גרפיים בדף על בסיס קואורדינטות מוגדרות.

  • פיתוח OCR חוצה שפות

    בניית מערכות זיהוי תווים אופטי עבור שפות דלות משאבים, בעיקר שפות הודיות.

איפה זה נופל

הטקסטים והתיוגים נוצרו במכונה ולא נאספו ממסמכים אנושיים אותנטיים. תרגום מכונה נוטה לפספס הקשרים תרבותיים, ועיוותים סינתטיים לא תמיד מדמים סריקות אמיתיות של נייר מקומט או צילום מטושטש. עברית חסרה כאן לחלוטין. אין גם חלוקה מובנית לסט בדיקה או ולידציה, כך שתצטרכו לפצל את הנתונים בעצמכם כדי למנוע זליגת מידע לפני הערכת ביצועים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. המאגר מוגדר תחת רישיון CC-BY-NC-4.0 שמגביל את השימוש למחקר ולמטרות לא מסחריות בלבד. שימוש במודל שאומן עליו בתוך מערכת עסקית מפר את תנאי הרישיון.

האם המאגר כולל תמיכה בעברית?

לא. יש בו 22 שפות שונות, כולל ערבית ומגוון רחב של שפות הודיות, אבל עברית לא נכללת באף אחת מהתצורות.

כמה שוקל המאגר להורדה?

כל שפה בנפרד שוקלת בין 27 ל־41 גיגה בייט בקבצים מכווצים. אם תרצו להוריד את כל 22 השפות, תצטרכו להקצות מעל 800 גיגה בייט להורדה ויותר מטרבייט לאחסון הנתונים הפרוסים.

מאיפה הגיעו הנתונים ואיך הם נוצרו?

המסמכים, הטקסטים והתיוגים כולם סינתטיים ונוצרו על ידי מכונה. הטקסטים תורגמו מאנגלית לשפות היעד ושובצו בתוך תבניות מסמכים קבועות מראש עם גופנים מוגדרים.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון שם התצורה הרצויה לפי קוד השפה, למשל ar או hi. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה בקבצי Parquet. שימו לב לנפח: כל שפה שוקלת בין 27 ל־41 גיגה בייט להורדה ומגיעה ליותר מ־40 גיגה בייט בזיכרון, כך שהורדה מלאה של כלל השפות דורשת קרוב לטרבייט של נפח אחסון פנוי. השדות המרכזיים לעבודה הם regions שמכיל את התיבות והטקסט, ו־vqa שמחזיק את השאלות והתשובות.

from datasets import load_dataset

ds = load_dataset("Cognitive-Lab/NayanaOCR_Corpus_2025")

הרישיון

המאגר מופץ תחת רישיון CC-BY-NC-4.0 לצד רישיון מחקר ייעודי של הפרויקט. הרישיון אוסר שימוש מסחרי מכל סוג ומחייב מתן קרדיט ליוצרים. אימון מודל על הנתונים האלה יכבול את התוצר למטרות מחקר בלבד, ולא תוכלו לשלב אותו במוצר שמייצר הכנסה או מוצע כשירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗