GPT
F

finemath

קוד פתוח

HuggingFaceTBodc-by2024-11-25

עשרות מיליארדי תומכי מתמטיקה חינוכית שעברו סינון קפדני מתוך CommonCrawl. הוא נבנה כדי ללמד מודלים שרשראות חשיבה ופתרון בעיות צעד אחר צעד, במקום מאמרים אקדמיים כבדים.

  • 34,339הורדות בחודש
  • 378לייקים

מה זה

המאגר מכיל דפי רשת בפורמט Markdown ונוטציית LaTeX סטנדרטית, שנאספו מתוך דפי CommonCrawl ומבוססים על כתובות של FineWeb, OpenWebMath ו־InfiMM-WebMath. הטקסט חולץ בעזרת הצינור של OpenWebMath כדי לשמר נוסחאות מתמטיות, ועבר סיווג איכות באמצעות מודל שחונך על הערכות של Llama-3.1-70B-Instruct בסולם של חמש דרגות. הטקסטים עברו ניקוי כפילויות באמצעות MinHash-LSH וניקוי מגע עם מבחני הערכה ידועים.

התוכן מחולק לארבע תצורות שונות. הראשונה היא finemath-3plus שכוללת 34 מיליארד טוקנים ו־21.4 מיליון מסמכים ברמת איכות של 3 ומעלה. השנייה היא finemath-4plus, תת-קבוצה מזוקקת של 9.6 מיליארד טוקנים שקיבלה ציונים גבוהים במיוחד ומציגה הסברים מפורטים. בנוסף שוחררו שתי תצורות מקבילות המבוססות על טקסט מסונן מתוך InfiMM-WebMath, בשם infiwebmath-3plus ו־infiwebmath-4plus בהיקף של 20.5 ו־8.5 מיליארד טוקנים.

מתאים ל

  • אימון יכולות חשיבה

    אימון מודלי שפה על פתרון בעיות מתמטיות בשלבים והסברים מובנים ב־LaTeX.

  • שיפור ביצועים במבחנים

    אימון המשך להעלאת ציונים במבחני הערכה כמו GSM8k ו־MATH.

  • סינון דאטה מתמטי

    שימוש בתצורות 4plus כדוגמאות איכות לבניית מסננים ומדרגי תוכן חינוכי.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, וכל תוכן בשפות אחרות הוסר במכוון. הסינון התמקד במתמטיקה חינוכית והסברית פופולרית, ולכן הוא לא מתאים למי שמחפש מתמטיקה מחקרית ברמות הגבוהות ביותר. נוסחאות שהופיעו בתמונות לא שומרו, ויש שונות באיכות לאורך מסמכים ארוכים גם בתוך דפים שקיבלו ציון גבוה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, רישיון ODC-By מאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מסחריים. התנאי המרכזי הוא מתן קרדיט וייחוס מתאים ליוצרי המאגר, לצד עמידה בתנאי השימוש של CommonCrawl.

האם הדאטהסט כולל תוכן בעברית?

לא. המאגר עבר סינון לשוני באמצעות מערכת הסיווג של FineWeb, וכל תוכן שאינו באנגלית הוסר לחלוטין. אם המטרה היא אימון על מתמטיקה בעברית, המאגר הזה לא יספק נתונים בשפה.

איך נמנע זיהום של מבחני ביצועים במודלים?

היוצרים הסירו דגימות שהכילו חפיפה של 13-גרם מול סטים של מבחנים מוכרים, כולל GSM8k, MATH, MMLU ו־ARC. המהלך בוצע לפי השיטה של Qwen2.5-Math, ודוחות הזיהום פורסמו במאגר ייעודי.

מה ההבדל בין גרסת 3plus לגרסת 4plus?

גרסת 3plus כוללת 34 מיליארד טוקנים של תוכן מתמטי בציון סביר ומעלה. גרסת 4plus היא תת-קבוצה של 9.6 מיליארד טוקנים בציון איכות גבוה יותר, שמתמקדת בהסברים מפורטים ומביאה לתוצאות טובות יותר במבחני חשיבה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון המזהה HuggingFaceTB/finemath ואחת מארבע התצורות, למשל finemath-4plus לאימון ממוקד או finemath-3plus למאגר המלא. המאגר פתוח לציבור ואינו דורש אישור גישה מראש. הנתונים מאוחסנים ב־293 קבצים, בעיקר קובצי Parquet מחולקים, ומומלץ להשתמש בפרמטר עיבוד מקבילי כמו num_proc בזמן הטעינה כדי להתמודד עם נפח המסמכים הגדול.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/finemath")

הרישיון

המאגר מופץ תחת רישיון ODC-By v1.0, שמאפשר שימוש מסחרי, שינוי והפצה כל עוד נותנים ייחוס מתאים ליוצרים. השימוש כפוף גם לתנאי השימוש של CommonCrawl. הרישיון אינו מחייב שיתוף של תוצרים או מודלים מאומנים תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗