GPT
S

swallow-math-v2

קוד פתוח

tokyotech-llmapache-2.02025-10-19

  • math

המאגר כולל 32 מיליארד טוקנים של תוכן מתמטי שנכתב מחדש באמצעות מודלי שפה, ומיועד למי שרוצה לאמן מודל להסקה מתמטית תחת רישיון פתוח לחלוטין.

  • 11,956הורדות בחודש
  • 33לייקים

מה זה

בסיס הנתונים נשען על FineMath-3+, סינון מתמטי מתוך CommonCrawl. החוקרים לקחו את הטקסטים הגולמיים, סיננו קטעים ארוכים מדי לפי מגבלות הקשר, וחילצו את המקטעים המתמטיים בעזרת Qwen3-32B. לאחר מכן הם שכתבו את כל החומר בעזרת Qwen3-235B-A22B-2507-Instruct כדי לנקות רעשים, להוסיף הקשרים חסרים ולבנות הסברים צעד אחר צעד בפורמטים של Markdown ו־LaTeX.

התוצר הסופי מחולק בעיקר לשני סגנונות. החלק הראשון הוא stage3-qa, שמכיל 12,635,739 דוגמאות בפורמט שאלות ותשובות בהיקף של 13.6 מיליארד טוקנים, כולל קטעי קוד פייתון לחישוב. החלק השני הוא stage3-textbook, שכולל 13,302,336 דוגמאות בסגנון ספרי לימוד עם רקע תיאורטי, גזירות מלאות ודוגמאות, בהיקף של 18.3 מיליארד טוקנים. במאגר קיימים גם שלבי הביניים ששימשו לסינון ולניסויי אבלציה.

מתאים ל

  • אימון מודל על פתרון בעיות

    אימון מקדים או כוונון עדין על שלב ה־Q&A לצורך שיפור פתרון בעיות מילוליות והסקת מסקנות צעד אחר צעד.

  • הוראת מושגים מורכבים

    שימוש בחלק ה־textbook כדי ללמד מודלים להסביר עקרונות מתמטיים, הוכחות ונוסחאות בצורה מובנית ומפורטת.

  • שילוב קוד בפתרון מתמטי

    אימון מודלים לייצר מימושי פייתון שמאמתים חישובים גיאומטריים ואלגבריים מתוך דוגמאות השאלות והתשובות.

איפה זה נופל

כל הנתונים הם באנגלית בלבד, כך שאין כאן מענה למי שבונה מודל להסקה מתמטית בעברית. בנוסף, כל ההסברים עברו שכתוב סינתטי מלא על ידי מודל שפה, מה שעלול לשמר הזיות או שגיאות לוגיות עדינות שהמודל הכניס במהלך הניסוח מחדש. במבחן MATH, גרסת השאלות והתשובות הציגה ביצועים מעט נמוכים יותר מ־Nemotron-CC-Math-v1-4+, כך שיש פשרה קלה ביכולת לטובת חופש השימוש.

אותה משפחה

swallow-math יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. הנתונים שוחררו תחת רישיון Apache 2.0, שמתיר שימוש מסחרי ישיר ואימון מודלים מסחריים ללא הגבלת Copyleft.

האם יש במאגר שאלות או הסברים בעברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד, שמקורם בסינון של CommonCrawl.

במה הוא שונה מגרסת SwallowMath הקודמת?

גרסה 1 כללה 3.6 מיליארד טוקנים ושוחררה ברישיון קהילתי של Llama 3.3. גרסה 2 גדלה ל־32 מיליארד טוקנים, שוכתבה באמצעות מודלי Qwen3, ועברה לרישיון Apache 2.0 שפתוח לחלוטין לשימוש.

באיזה חלק של המאגר כדאי להשתמש לאימון?

הבחירה תלויה במשימה שלכם. לפי ממצאי המפתחים, תצורת Q&A הניבה את התוצאות הטובות ביותר על GSM8K ו־GSM-Plus, בעוד שתצורת Textbook הובילה בביצועים על מבחן BBH.

איך טוענים

המאגר מכיל 889 קבצים, רובם בפורמט jsonl שמחולקים לפי שלבי העבודה. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה דרך Hugging Face. בגלל שמדובר בעשרות מיליוני רשומות ובמיליארדי טוקנים, מומלץ לא למשוך את כל התיקיות אלא לגשת ישירות לתיקיית stage3-qa או stage3-textbook בהתאם ליעד האימון שלכם.

from datasets import load_dataset

ds = load_dataset("tokyotech-llm/swallow-math-v2")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי ומחקרי מלא, שינוי של הנתונים והפצה מחודשת, ללא דרישה להפיץ עבודות נגזרות תחת אותו הרישיון. אתם יכולים לאמן עליו מודלים פנימיים או מסחריים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗