GPT
L

latex-formulas

קוד פתוח

OleehyOopenrail2023-07-29

  • ocr
  • latex-ocr
  • image2latex

המאגר מחבר בין תמונות של נוסחאות מתמטיות לקוד המקור שלהן בלטך. הוא מתאים למי שבונה מודל ראייה שממיר צילומי משוואות למלל מתמטי עביר.

  • 369הורדות בחודש
  • 103לייקים

מה זה

המאגר כולל צמדים של תמונות נוסחאות וקוד לטך תואם, שנאספו במקור מסריקה של כמיליון נוסחאות ממאמרי ארכייב ללא ניקוי או חלוקת טקסט. הנתונים מחולקים לשתי תצורות: הראשונה נקראת raw formulas ומכילה את המידע הגולמי שנאסף מסביבות כמו equation, align ו־gather, לאחר הסרת פקודות עימוד ורווחים כמו vspace, hspace, makebox ו־label.

התצורה השנייה נקראת cleaned formulas וכוללת כ־550 אלף זוגות מפולטרים. היא נוצרה מאיחוד החומר הגולמי עם המאגר im2latex-100K, תוך סינון אגרסיבי. יוצרי המאגר מחקו נוסחאות מורכבות מדי שאורכן עולה על 200 תווים, תמונות עם יחס גובה-רוחב שחורג מ־0.8, ונוסחאות שכללו מאקרואים מותאמים אישית. כמו כן הוסרו פקודות כמו tag, text ו־split, וסביבות המשוואה השונות הומרו לסביבת align* אחידה.

מתאים ל

  • זיהוי תווים אופטי לנוסחאות

    אימון מודלים שמקבלים תמונת משוואה ומייצרים את קוד הלטך התואם שלה.

  • הערכת ביצועי מודלי ראייה

    בדיקת דיוק של מודלים קיימים בהמרת תמונות נוסחאות למחרוזת מתמטית.

  • אימון מודל תמלול TexTeller

    שחזור התהליך ששימש את מפתחי המאגר לבניית מודל זיהוי הנוסחאות שלהם.

איפה זה נופל

הסינון של המאגר מקצץ באופן מודע נוסחאות ארוכות מעל 200 תווים או כאלה עם מבנה חריג, כך שהנתונים מוטים בעיקר לנוסחאות קצרות ונקיות. פקודות טקסט ומאקרו מותאם הוסרו לחלוטין, ולכן מודל שילמד עליו יתקשה מאוד לפענח הערות מילוליות בתוך משוואות. הנתונים מגיעים מארכייב ומשקפים סגנון כתיבה אקדמי באנגלית, בלי שום תמיכה בכיווניות ימין-שמאל או בעברית.

אותה משפחה

latex-formulas יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם יש במאגר נוסחאות עם עברית?

לא. כל הנתונים נסרקו ממאמרים בארכייב ומתבססים על חבילות לטך סטנדרטיות באנגלית. בנוסף, פקודות שמכילות מלל חופשי כמו text הוסרו בשלב הניקוי.

מאיפה הגיעו התמונות והטקסט?

החומר הגולמי נאסף בסריקה של כמיליון משוואות מתוך מאמרים מדעיים בארכייב. הגרסה המנוקה שולבה יחד עם דוגמאות ממאגר מוכר נוסף בשם im2latex-100K.

מה ההבדל בין הגרסה הגולמית לגרסה המנוקה?

הגרסה המנוקה כוללת כ־550 אלף זוגות לאחר סינון קפדני של נוסחאות ארוכות מ־200 תווים ויחסי תמונה חריגים. הגרסה הגולמית מכילה את הטקסט המקורי מסריקת המאמרים כמעט ללא סינון.

האם אפשר להשתמש במאגר למטרות מסחריות?

הרישיון המוגדר הוא openrail, שמאפשר שימוש נרחב אך מחייב עמידה במגבלות שימוש ספציפיות המוגדרות ברישיון. כדאי לבדוק את תנאי הרישיון המלאים לפני שילוב המידע במוצר מסחרי.

איך טוענים

טוענים את המידע ישירות באמצעות פונקציית load_dataset של ספריית datasets, תוך ציון המזהה ושם התצורה המבוקשת, raw_formulas או cleaned_formulas. המאגר ציבורי ופתוח להורדה מיידית, כך שאין צורך לבקש אישור גישה מוקדם או להמתין למפתח. לפי מבנה הקבצים, גרסת הנתונים המנוקה מפוצלת לשישה קובצי parquet שונים.

אם אתם מתכננים לרנדר בעצמכם תמונות מקוד המקור של הנוסחאות, צריך לוודא שמותקנות במערכת חבילות הלטך החיצוניות amsmath, amsfonts, amssymb ו־mathtools. בלעדיהן חלק גדול מהתחביר המתמטי לא יתקמפל.

from datasets import load_dataset

ds = load_dataset("OleehyO/latex-formulas")

הרישיון

הרישיון המדווח הוא openrail. רישיונות מסוג זה מאפשרים לרוב שימוש חופשי ופיתוח מודלים, אך הם כוללים מגבלות שימוש שמטרתן למנוע יישומים מזיקים. הכללים עשויים לחול גם על מודלים שמאומנים על המידע.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא ב־Hugging Face ↗