GPT
S

swallow-math

קוד פתוח

tokyotech-llmllama3.32025-05-01

  • math

מאגר מתמטי של 2.3 מיליארד טוקנים שעבר שכתוב מלא בידי Llama-3.3-70B-Instruct. הוא מיועד למי שמאמן מודלים ורוצה פתרונות צעד אחר צעד במקום רעש של אתרי אינטרנט.

  • 1,104הורדות בחודש
  • 49לייקים

מה זה

החומר מתבסס על FineMath-4+, מקבץ שסונן במקור מתוך CommonCrawl והכיל כ־9.6 מיליארד טוקנים ו־6.7 מיליון מסמכים. היוצרים היפנים לקחו את המידע הגולמי הזה והעבירו אותו תהליך שכתוב אוטומטי מקיף כדי להפוך אותו לקריא ומועיל יותר להבנה מתמטית.

הצינור שפותח באמצעות מודל Llama-3.3-70B-Instruct ביצע שלושה דברים עיקריים. הוא ניקה לחלוטין זבל של אתרים כמו כותרות עליונות, חתימות, הצהרות פרטיות וחותמות זמן של שאלות ותשובות. לאחר מכן הוא השלים הקשר חסר בשאלות או תשובות מקוטעות. לבסוף, הוא ניסח מחדש את כל הפתרונות כהסברים שיטתיים צעד אחר צעד, עם נוסחאות מסודרות בפורמט Markdown ו־LaTeX.

התוצאה מקוצצת בנפח הטוקנים לעומת המקור אך צפופה בהרבה מבחינת נימוקים מתמטיים. הטקסטים מאורגנים בקובצי JSONL ומציגים תוכן שמתמקד בחשיבה חישובית והסברי שלבים ולא בגלישת רשת מבולגנת.

מתאים ל

  • אימון מקדים מתמשך

    חיזוק יכולות מתמטיות של מודלי שפה קיימים על ידי הוספת טקסטים עמוסי פתרונות צעד אחר צעד.

  • אימון מודלי הסקה

    לימוד מודלים לפרק שאלות מורכבות למבנה שלבי מסודר באמצעות פורמט Markdown ו־LaTeX.

  • בניית סינתזה להוראה

    שימוש בטקסטים המשוכתבים כבסיס לחומרי הדרכה ופתרונות ברורים לבעיות מדעיות ומתמטיות.

איפה זה נופל

החומר כתוב באנגלית בלבד ואינו כולל שפות אחרות, כך שהוא לא יעזור לאימון מודלים בעברית. בנוסף, הוא יורש את כל ההטיות הפנימיות של FineMath-4+, כולל ייצוג יתר אפשרי של תחומים כמו אלגברה על חשבון גיאומטריה. מכיוון שהתוכן שוכתב על ידי Llama-3.3-70B-Instruct, הפתרונות מושפעים באופן מובהק מסגנון הניסוח, קיבובי המילים והפורמט המועדף על המודל הזה. קיימת גם כבר גרסת v2 עדכנית יותר מאוקטובר 2025 של אותם יוצרים.

אותה משפחה

swallow-math יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הדאטהסט כולל תוכן בעברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד. אם המטרה שלכם היא מודל שמבין מתמטיקה בעברית, תצטרכו לתרגם את החומר או להוסיף מקורות מקומיים.

מותר להשתמש בו לפרויקט מסחרי?

הרישיון הוא Llama 3.3 Community License שמאפשר עבודה מסחרית בכפוף לתנאים של מטא, יחד עם תנאי CommonCrawl. אם המוצר מגיע למאות מיליוני משתמשים חודשיים יש צורך ברישיון מיוחד ממטא.

מה ההבדל בין המאגר הזה ל־FineMath-4 המקורי?

בניגוד לטקסט המקורי שחולץ מהרשת והכיל חלקי אתרים ותשובות קטועות, כאן עבר כל מסמך שכתוב על ידי Llama 3.3 70B. הפתרונות נוסחו מחדש בצורה שיטתית והרעש מסביב הוסר.

האם זו הגרסה הכי עדכנית של הדאטהסט?

לא. באוקטובר 2025 פרסמו החוקרים את SwallowMath-v2 עם שיפורים בצינור השכתוב, ולכן כדאי לבדוק גם את הגרסה החדשה לפני שמתחילים אימון ארוך.

איך טוענים

המאגר מחולק לשני קובצי train בפורמט jsonl ואינו דורש תהליך בקשת גישה או אישור מיוחד ב־Hugging Face. אפשר לטעון אותו ישירות עם ספריית datasets הרגילה. גודלו המדווח עומד על בין מיליון לעשרה מיליון רשומות, וכולל כ־2.3 מיליארד טוקנים של טקסט מעובד. השדה המרכזי שמעניין אתכם באימון מכיל את הטקסט המשוכתב עם נוסחאות ב־LaTeX, ולכן כדאי לוודא שהטוקנייזר שלכם יודע להתמודד היטב עם תחביר מתמטי ותגי Markdown לפני שמתחילים להריץ.

from datasets import load_dataset

ds = load_dataset("tokyotech-llm/swallow-math")

הרישיון

המאגר מופץ תחת רישיון Llama 3.3 Community License, לצד כפיפות לתנאי השימוש של CommonCrawl. הרישיון של מטא מאפשר שימוש מסחרי ומחקרי אך כולל מגבלות ספציפיות, בין היתר תנאי היקף משתמשים חודשיים והגבלות על שימוש בפלט לאימון מודלים מתחרים לפי תנאי מטא. יש לבדוק את התאמת הרישיון לפני שילובו במוצר.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗