GPT
A

AutoMathText

קוד פתוח

math-aicc-by-sa-4.02024-01-24

  • mathematical-reasoning
  • reasoning
  • finetuning
  • pretraining
  • llm

מאגר של טקסטים מתמטיים באנגלית בהיקף של כ־200 גיגה-בייט. הנתונים סוננו ודורגו באמצעות מודל שפה, מה שמאפשר לחתוך ישירות לחומרים בדירוג איכות גבוה בלי לנקות לבד.

  • 11,718הורדות בחודש
  • 185לייקים

מה זה

המאגר מאגד טקסט מתמטי, קוד ותיעוד שנאספו משלושה מקורות עיקריים: OpenWebMath, RedPajama, ו־Algebraic Stack מתוך Proof-Pile-2. התכנים מגיעים מאתרי אינטרנט, מאמרים מ־arXiv ומאגרי גיטהאב.

במקום סינון ידני או חוקים יבשים, המפתחים השתמשו במודל Qwen-72B שסרק את הטקסטים והצמיד לכל קטע ציון בין 0 ל־1 בשדה lm_q1q2_score. הציון משקף את הרלוונטיות, האיכות והערך הלימודי של הקטע בהקשר מתמטי.

הקבצים מחולקים לפי מקורות וטווחי ציונים בפורמט jsonl, למשל חלוקה בין ציונים נמוכים לגבוהים במאמרי arXiv או תכנים מהרשת. החלוקה הזו מאפשרת למשוך רק את השכבה העליונה של הנתונים בלי להוריד את כל המאגר.

מתאים ל

  • אימון מודלים למתמטיקה

    אימון מקדים או המשך אימון של מודלי שפה על טקסט מתמטי וקוד שסוננו לרמת איכות גבוהה.

  • מחקר על סינון נתונים

    בדיקת הקשר בין ציוני איכות של מודל שפה חיצוני לבין ביצועי המודל הסופי שמתאמן עליהם.

  • אימון מערכות מענה לשאלות

    שימוש בתכנים המדורגים גבוה כדי לשפר פתרון בעיות והסברים מתמטיים שלב אחר שלב.

איפה זה נופל

כל הטקסטים במאגר הם באנגלית בלבד, ואין כאן ייצוג לעברית או לשפות אחרות. מעבר לכך, כל הדירוג והסינון נשענים לחלוטין על מודל השפה Qwen-72B. אם המודל סובל מהטיות מסוימות, טועה בהבנת הוכחות מורכבות או מעדיף סגנון כתיבה ספציפי, ההטיה הזו מוטמעת ישירות בתוך הציונים של הדאטהסט. חובה לבדוק מדגמית את הקטעים לפני שמשתמשים בהם כבסיס להערכה אקדמית מדויקת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הוא cc-by-sa-4.0 שמתיר שימוש מסחרי עקרונית, אך דורש מתן קרדיט ושיתוף תחת אותו רישיון עבור יצירות נגזרות. אם אתם מתכוונים לאמן מודל מסחרי סגור, מומלץ לבדוק את ההשלכות של דרישת ה־ShareAlike מול גורם משפטי.

כמה נפח אחסון צריך כדי להוריד את הכל?

המאגר שוקל כ־200 גיגה-בייט ומורכב מ־501 קבצים. עם זאת, אין חובה להוריד את כולו, כי אפשר לטעון תצורות ספציפיות שמכילות רק חתך איכות מסוים או מקור נתונים בודד.

האם יש בדאטהסט תוכן בעברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד שמגיעים ממאמרים, אתרים ומאגרי קוד. אין בו נתונים מתמטיים בעברית.

איך המאגר הזה שונה מ־OpenWebMath או RedPajama?

הוא מתבסס עליהם ועל מקורות נוספים, אך מוסיף שכבת סינון ייחודית. במקום שתצטרכו לסנן רעשים בעצמכם, כל קטע עבר הערכה על ידי מודל Qwen-72B וקיבל ציון איכות שמאפשר לסנן את החומר לפי סף מוגדר מראש.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות ציון תצורה ספציפית, למשל web-0.50-to-1.00. הגישה חופשית ואינה דורשת אישור מראש. הנפח הכולל מגיע לכ־200 גיגה-בייט שמפוזרים על פני 501 קבצים, כך שאם אתם לא צריכים את הנתונים באיכות הנמוכה, כדאי לטעון רק קונפיגורציות של ציונים גבוהים. השדה המרכזי שצריך לעבוד איתו לצד הטקסט הוא lm_q1q2_score, שקובע את רף הסינון.

from datasets import load_dataset

ds = load_dataset("math-ai/AutoMathText")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-4.0. הרישיון מתיר שימוש מסחרי ומחייב מתן קרדיט ליוצרים. המלכוד המרכזי הוא סעיף השיתוף הזהה: אם אתם מעבדים, משנים או בונים נגזרת ישירה מהדאטהסט, אתם מחויבים להפיץ אותה תחת אותו רישיון בדיוק. לגבי מודלים שאומנו עליו, המעמד המשפטי של שיתוף זהה אינו חד משמעי ומחייב בדיקה משפטית לפני שילוב במוצר מסחרי סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗