GPT
A

AutoMathText-V2

קוד פתוח

OpenSQZרישיון לא דווח2025-08-20

  • LLM
  • pretraining
  • finetuning
  • midtraining
  • reasoning

קורפוס ענק לאימון מקדים של מודלי שפה, שמרכז 2.46 טריליון טוקנים עם דגש חזק על מתמטיקה, קוד והסקה לוגית. הוא מסנן ומדרג עשרות מקורות מובילים לפי איכות כדי לחסוך עבודת ניקוי עצמאית.

  • 44,422הורדות בחודש
  • 78לייקים

מה זה

המאגר כולל עשרות מיליארדי רשומות טקסט בפורמט פרקט, שמקורן בלמעלה מחמישים מאגרי מידע שונים. שבעים אחוז מהתוכן מגיע מגרסאות איכותיות של נמוטרון ורשת כללית, לצד קטעי קוד מגיטהאב, מאגרי שאלות ותשובות מתמטיים, הוכחות פורמליות ודאטה חינוכי. כל רשומה מכילה את הטקסט המקורי, מזהה, כתובת אתר, מטא דאטה על המקור, ספירת טוקנים לפי המקודד של קוון 2.5, וציון איכות רציף.

הסינון מתבסס על ניקוי ייעודי שמגן על תחביר לאטך ובלוקים של קוד, לצד הסרת דליפות של מבחני הערכה ידועים כמו ג'י אס אם שמונה קיי. תהליך מניעת הכפילויות משלב התאמה מדויקת ברמת גיבוב, דמיון מבוסס מין האש, והסרה סמנטית באמצעות וקטורים. בנוסף, מודל קוון אומן לסווג איכות ולתת ציונים, שעל בסיסם חילקו את הנתונים לעשירונים בכל תחום תוכן.

מתאים ל

  • אימון מקדים למודל הסקה

    בניית יכולות פתרון בעיות מתמטיות והסקה לוגית שלב אחר שלב באמצעות קורפוס ייעודי ומסונן.

  • העשרת מודלים כלליים

    הוספת נתונים מדעיים ברמת ניקוי גבוהה כדי לשפר הבנת קוד ונוסחאות מורכבות במודל שפה קיים.

  • אימון על תתי איכות

    דגימה ממוקדת של העשירונים העליונים בלבד לצורך כוונון עדין או אימון קצר ואיכותי.

איפה זה נופל

הטקסטים מוגבלים כמעט לחלוטין לאנגלית, שתופסת כתשעים וחמישה אחוזים מהנפח, ולסינית שלוקחת כחמישה אחוזים. אין כאן עברית כלל. מגבלה כבדה נוספת היא תחום הקוד, שבו הטקסט עצמו הושמט מהמאגר ונשמרו רק מזהי בלוּב, מה שמחייב משיכה עצמאית מסובכת מאחסון ענן חיצוני. בנוסף, הציון נקבע על ידי מודל שפה, מה שמכניס הטיות סינון מובנות של אותו מסווג.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

התשובה מורכבת ומחייבת זהירות. הרישיון הכולל מבוסס על הסכם ייעודי של הפרויקט, אך חלקים מתוכו, כמו מאגר הקוד, מוגבלים מפורשות לשימוש אקדמי בלבד. שימוש מסחרי מלא מחייב סינון והוצאה של תתי המאגרים המגבילים.

כמה שטח אחסון צריך בשביל להוריד אותו?

המאגר כולל עשרים ושישה אלף קבצים שמייצגים מעל שני טריליון טוקנים. מדובר בנפח של כמה טרה בייטים, כך שהורדה מלאה דורשת תשתית אחסון ארגונית ייעודית. ברוב המקרים עדיף להזרים את הנתונים ישירות בזמן האימון.

האם יש בדאטהסט הזה תוכן בעברית?

אין במאגר עברית כלל. התוכן מתחלק בין אנגלית, שמהווה כמעט את כל החומר, לבין סינית בהיקף של כחמישה אחוזים בלבד. למודל שמיועד לשוק המקומי תצטרכו להביא מקורות שפה נפרדים לחלוטין.

במה הוא שונה ממאגרי רשת רגילים כמו קומונקראול?

רוב החומר כאן עבר ניקוי ששומר על נוסחאות מתמטיות ובלוקים של קוד שלא יישברו. בנוסף הופעל סינון תלת שלבי לכפילויות, דורגו ציוני איכות בעזרת מודל שפה, וסוננו מראש שאלות ממבחני ביצועים נפוצים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס של הגפינג פייס. בגלל היקף של 26,293 קבצים והיקף טוקנים עצום, חובה לעבוד עם סטרימינג ולא לנסות להוריד הכל לדיסק מקומי בבת אחת. אין צורך באישור גישה מיוחד למאגר עצמו, אבל תחום הקוד דורש חיבור נפרד להורדת התוכן בפועל דרך אמזון אס שלוש. השדות החשובים לסינון הם ציון האיכות, שם התחום ומספר הטוקנים.

from datasets import load_dataset

ds = load_dataset("OpenSQZ/AutoMathText-V2")

הרישיון

המאגר שוחרר תחת הסכם ייעודי בשם אוטו מאת' טקסט, אך תנאי הרישיון המלאים לא מפורטים במלואם בדף הראשי. בנוסף, תת המאגר של הקוד מוגדר לשימוש אקדמי בלבד, מה שמטיל צל כבד על שימוש מסחרי במודל שמתאמן על כלל החומר. אם אתם בונים מודל למוצר מסחרי, תצטרכו לבודד רק את התחומים שמקורם ברישיונות פתוחים ולהימנע מאימון עיוור על הכל.

הרישיון המלא ב־Hugging Face ↗