GPT
L

linxy/LaTeX_OCR

קוד פתוח

linxyapache-2.02024-06-10

  • code

המאגר מרכז תמונות של נוסחאות מתמטיות יחד עם קוד הלטך התואם שלהן. הוא מתאים למי שבונה או בוחן מודלים לזיהוי תווים אופטי מנוסחאות מודפסות ומשורבטות.

  • 848הורדות בחודש
  • 181לייקים

מה זה

הרשומות במאגר מכילות זוגות פשוטים של תמונת נוסחה ומחרוזת הטקסט שלה בלטך. הנתונים הגיעו ממאגרי עבר כמו Zenodo ופרויקט CROHME, לצד דוגמאות שהיוצרים בנו לבד. הסינון הראשוני נעשה באמצעות עץ תחבירי מופשט של לטך, שדרכו זרקו לפח נוסחאות שלא התקמפלו או רינדרו שגיאות.

התוכן מחולק לחמש תצורות שונות. יש ערכת בדיקה זעירה של 110 דוגמאות, מאגר מלא של כמעט מאה אלף תמונות מודפסות, ומאגר מקביל בגודל דומה של כתב יד שנוצר באופן סינתטי באמצעות גופנים מיוחדים. בנוסף יש שני חלקים קטנים יותר שמבוססים על CROHME, אחד עם כתב יד אמיתי ממסכי מגע ואחד שבו אותן נוסחאות רונדרו בחזרה לדפוס נקי.

מתאים ל

  • זיהוי משוואות מסריקות

    אימון מודלים להמרת צילומי נוסחאות מודפסות מדוחות ומאמרים אקדמיים ישירות לקוד לטך נקי.

  • פענוח כתב יד בטאבלטים

    הערכת ביצועים של מערכות קלט גרפי שממירות שרבוטי נוסחאות של משתמשים לקוד דיגיטלי בזמן אמת.

  • הכשרת מודלי ראייה

    שימוש בתמונות המקוטלגות כחלק ממערך אימון למודלי ויז'ן שמיועדים להבנת מסמכים טכניים ומדעיים.

איפה זה נופל

המאגר מתמקד בנוסחאות מבודדות בלבד. אין כאן מסמכים שלמים, פסקאות מעורבות או טקסט בעברית ובשפות שאינן אנגלית וסימנים מתמטיים. אם הדפים שלכם מכילים הסברים מילוליים מסביב לנוסחה, המודל שתאמנו פה ייכשל לחלוטין.

בעיה נוספת היא החלק הסינתטי של כתב היד. גופנים שמחקים כתיבה לא באמת מדמים את הבלגן, מריחות הדיו והטעויות של כותב אנושי. בנוסף, לא מצוין בכרטיס אילו גרסאות של חבילות לטך נתמכות, מה שעלול לייצר הפתעות בפקודות מורכבות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא אפאצ'י שתיים אפס, והוא מתיר שימוש מסחרי חופשי. עליכם רק לתת ייחוס ליוצר המקורי ולכלול עותק של הרישיון.

האם יש בדאטהסט תמיכה בטקסט בעברית?

לא. הדאטהסט כולל רק סימנים מתמטיים וקוד לטך סטנדרטי שנכתב באותיות לטיניות ויווניות. אין בו מילים בעברית או תמיכה בכיווניות מימין לשמאל.

איך נוצרו נתוני כתב היד במאגר?

יש שני מקורות שונים. חלק אחד נוצר על ידי הלבשת גופני כתב יד על נוסחאות מודפסות, וחלק אחר נלקח ממאגר קרוהם שמכיל כתב יד אמיתי שנאסף ממשתמשים על מסכי מגע.

האם המאגר דורש הרשמה מראש או בקשת גישה?

לא. המאגר פתוח לציבור ויושב ישירות בשרתי האגינג פייס. אפשר לטעון אותו מיידית בסביבת הפיתוח בעזרת שורת פקודה בודדת בספריית הדאטהסטים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים הרגילה בפייתון בלי צורך באישור גישה או מפתח מיוחד. הקבצים שמורים בפורמט פרקט, ומחולקים לחלוקות של אימון, ולידציה ובדיקה.

בזמן הטעינה צריך להגדיר במפורש את התצורה הרצויה מתוך החמש הזמינות. המבנה מינימליסטי לגמרי, רק שני שדות בכל שורה: שדה התמונה ושדה הטקסט שמחזיק את קוד הלטך הגולמי.

from datasets import load_dataset

ds = load_dataset("linxy/LaTeX_OCR")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הנתונים, ולאמן עליו מודלים פנימיים או חיצוניים בלי חובת שיתוף של הקוד שלכם תחת אותו רישיון. החובה היחידה היא מתן קרדיט מתאים ושמירה על הודעות זכויות היוצרים של היוצר המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗