GPT
U

UltraData-Math

קוד פתוח

openbmbapache-2.02026-01-14

  • llm
  • pretraining
  • math
  • data-synthesis
  • data-filtering

מעל 290 מיליארד טוקנים של תוכן מתמטי מסונן ומעובד בשלוש רמות איכות שונות. המאגר נבנה במיוחד לאימון מקדים של מודלי שפה כדי לשפר יכולות חשיבה ופתרון בעיות.

  • 23,331הורדות בחודש
  • 342לייקים

מה זה

המאגר כולל עשרות מיליוני מסמכים שמקורם ברשת, בעיקר ממאגרי Common Crawl, שעברו פירוק ייעודי לשמירה על נוסחאות והמרתן לפורמט LaTeX תקני. במקום להסתמך על חולצי רשת רגילים שנוטים להרוס מבנה מתמטי, נעשה כאן שימוש במפענח ייעודי שמחלץ דיונים, טקסטים ופורומים תוך שימור הסימול המדויק.

התוכן מחולק לשלוש רמות עיבוד עוקבות. הרמה הראשונה L1 כוללת 170.5 מיליארד טוקנים של טקסט רשת נקי מרווחים מיותרים, פרסומות וכפילויות מסמכים. הרמה השנייה L2 מכילה 33.7 מיליארד טוקנים שסוננו באמצעות מודל סיווג איכות, שהשאיר רק הסברים מפורטים, צעדי פתרון ודיונים אקדמיים. הרמה השלישית L3 מציעה 88 מיליארד טוקנים של תוכן סינתטי ומשוכתב, הכולל שאלות ותשובות, דיאלוגים מרובי שלבים בין מורה לתלמיד וספרי לימוד מובנים שנבנו סביב נקודות ידע ספציפיות.

מתאים ל

  • אימון מקדים למתמטיקה

    הרחבת יכולות החשיבה והפתרון של מודלי שפה על גבי מיליארדי טוקנים של נוסחאות LaTeX נקיות.

  • אימון מודלי שיחה והוראה

    שימוש בתת-המאגר L3 לבניית מודלים שמסוגלים להדריך תלמידים צעד אחר צעד בדיאלוג רב שלבי.

  • הערכת ביצועי מפענחים

    בדיקת איכות של חילוץ נוסחאות מורכבות מדפי אינטרנט בהשוואה לתוצרי מפענח L0 הייעודי.

איפה זה נופל

המאגר מוגבל לשפות אנגלית וסינית בלבד, ללא שום ייצוג לעברית או לשפות אחרות. נתוני הבסיס מגיעים מסריקות רשת של Common Crawl החל משנת 2014, מה שעלול להכיל סגנונות ישנים או שגיאות מקוריות שלא אותרו בסינון. מעבר לכך, חלק ניכר מרמה L3 נוצר באופן סינתטי על ידי מודלים מסחריים כמו Qwen ו־GLM, עובדה שמכניסה הטיות ניסוח של אותם מודלים ומחייבת בדיקת אמינות עובדתית של הפתרונות לפני שמסתמכים עליהם במוצר סופי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים פנימיים או מוצרים שיימכרו ללקוחות, כל עוד אתם שומרים על תנאי הייחוס של הרישיון המקורי. אין שום דרישה לשתף את המודל המאומן שלכם באותו אופן.

האם יש בדאטהסט תוכן בעברית?

לא, הדאטהסט כולל אך ורק אנגלית וסינית לפי הגדרות הסינון של הפרויקט. אם אתם מחפשים לשפר ביצועים מתמטיים של מודל הפונה לקהל ישראלי, תצטרכו לתרגם חלקים ממנו או לשלב מקורות נוספים בעברית. שימוש בנתונים כפי שהם יתרום ליכולת החישוב וההיגיון, אך לא לשפה המקומית.

מה המשקל של המאגר והאם אפשר להוריד אותו למחשב אישי?

המאגר מכיל מעל 290 מיליארד טוקנים ומחולק ל־1,831 קובצי Parquet, כך שמדובר בנפח עצום של מאות ג'יגה-בייט לפחות. לא מעשי להוריד את כולו לתחנת עבודה רגילה ללא מערך אחסון ייעודי. ברוב המקרים עדיף להוריד רק תת-קבוצה ספציפית מקטגוריות L2 או L3, או לטעון את הנתונים ישירות בשרת האימון.

במה UltraData-Math שונה ממאגרים מתמטיים פתוחים אחרים?

מרבית המאגרים הקיימים מסתמכים רק על ספרי לימוד ומאגרי תחרויות, או שמשתמשים בכלי חילוץ רשת ששוברים את מבנה הנוסחאות. כאן פותח כלי ייעודי שחילץ דיונים ופורומים מהרשת והמיר הכל לפורמט LaTeX אחיד. בנוסף, החלוקה לשלוש רמות איכות מאפשרת לבחור בין טקסט רשת גולמי לבין נתונים סינתטיים מובנים של שאלות ותשובות.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה datasets בעזרת load_dataset עם המזהה openbmb/UltraData-Math, תוך ציון הקונפיגורציה הרצויה כמו UltraData-Math-L1, UltraData-Math-L2-preview או אחד מתתי הסוגים של L3. המאגר פתוח לחלוטין ואינו דורש אישור גישה מראש. הקבצים מאוחסנים בפורמט Parquet בחלוקה ל־1,831 קבצים, כך שמומלץ לעבוד בסטרימינג או לוודא שיש לכם נפח אחסון מסיבי וחיבור רשת חזק לפני הורדה מלאה של מאות מיליארדי הטוקנים.

from datasets import load_dataset

ds = load_dataset("openbmb/UltraData-Math")

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי, הפצה והטמעה מלאה בחינם. הרישיון דורש מתן קרדיט ושמירה על הודעת הרישיון המקורית, אך אינו מחייב אתכם לחשוף את הקוד שלכם או לשחרר מודלים שאומנו עליו תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗