GPT
G

GLM-5.1-Reasoning-1M-Cleaned

קוד פתוח

Jackrongapache-2.02026-04-17

  • reasoning
  • chain-of-thought
  • instruction-tuning
  • sft
  • distillation

המאגר מרכז 746,321 דוגמאות חשיבה מזוקקות ממודל GLM-5.1 שמיועדות לאימון SFT. הוא רלוונטי למי שבונה מודלים מנמקים בתחומי מדעים ומתמטיקה עם שרשראות חשיבה ארוכות ומובנות.

  • 1,269הורדות בחודש
  • 294לייקים

מה זה

הנתונים מבוססים על מאגר מקור של Kassadin88, אך עברו סינון טכני שהסיר 20,214 רשומות פגומות. הסינון זרק מקרים של תשובות קטועות, סירובי מודל, פסקאות חשיבה שחזרו על עצמן וכפילויות מדויקות. הפלט עבר סטנדרטיזציה אחידה כך שכל שרשרת חשיבה עטופה בתגיות think מסודרות, ואחריהן מופיעה התשובה הסופית.

המאגר מחולק לארבעה חלקים עיקריים. החלק המרכזי כולל 527,737 דוגמאות להוראות כלליות והסקה, חלק המדעים ברמת דוקטורט מכיל 103,706 רשומות בפיזיקה, כימיה וביולוגיה, חלק ה־STEM הרב לשוני מחזיק 92,781 דוגמאות, וחלק המתמטיקה כולל 22,097 הוכחות וחישובים מורכבים.

מתאים ל

  • אימון SFT להסקה מורכבת

    לימוד מודלים לייצר שרשראות חשיבה מפורטות בתוך תגיות ייעודיות לפני הפקת התשובה.

  • חיזוק יכולות מתמטיקה

    הזנת המודל באלפי הוכחות מתמטיות ארוכות במיוחד עם עשרות אלפי טוקנים לתשובה.

  • אימון STEM ברמה מתקדמת

    שיפור ביצועים במשימות מדעיות מורכבות בכימיה, פיזיקה וביולוגיה ברמה אקדמית.

איפה זה נופל

ההסקה במאגר נשענת על מודל בודד, כך שכל טעות או סגנון ייחודי של GLM-5.1 מועתקים ישירות לנתונים. מבחינת שפות המאגר מוגדר לאנגלית ולסינית, ולכן הוא לא מתאים למי שמחפש כיסוי בעברית. בנוסף, אורכי הפלט קיצוניים. בתת המאגר של מתמטיקה חציון הפלט עומד על 24,498 טוקנים ומגיע ב־P95 ליותר מ־64 אלף, מה שמחייב חלונות הקשר ארוכים מאוד ומשאבי חישוב כבדים באימון.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מתועד עבור אנגלית וסינית בלבד בתחומי ה־STEM והמדעים. אין בו טקסטים ייעודיים בעברית ולא כדאי לבנות עליו לפרויקטים מקומיים.

כמה נפח אחסון נדרש כדי להוריד את כל המאגר?

ארבעת קובצי הנתונים שוקלים יחד כ־29.56 גיגה בייט. החלק המרכזי תופס כ־18.28 גיגה בייט, וקובצי המדעים והמתמטיקה נעים בין 3.5 ל־4 גיגה בייט כל אחד.

מה ההבדל בין המאגר הזה למאגר המקור של Kassadin88?

המאגר המקורי הכיל תגיות לא עקביות ופורמטים שונים של שרשראות חשיבה. הגרסה הזו ניקתה מעל עשרים אלף דוגמאות פגומות, סירובים וחזרות, והמירה את כל הדוגמאות לתחביר אחיד.

האם מותר להשתמש בדאטהסט הזה לפיתוח מודל מסחרי?

מבחינת רישיון Apache 2.0 השימוש המסחרי מותר לחלוטין. עם זאת, מכיוון שהתוכן נוצר כולו על ידי המודל GLM-5.1, מומלץ לוודא שתנאי השימוש המסחריים של יוצרי המודל המקורי אינם מגבילים זיקוק.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון תת המאגר הרצוי, למשל main או Math. אין צורך בבקשת גישה מיוחדת, והקבצים יושבים בפורמט jsonl עם נפח כולל של קרוב ל־30 גיגה בייט. כל שורה מכילה מבנה שיחה מוכן לצד שדות input ו־output שטוחים, שדה domain, ומטא-דאטה שסופר טוקנים ומציין את המודל המלמד.

from datasets import load_dataset

ds = load_dataset("Jackrong/GLM-5.1-Reasoning-1M-Cleaned")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומחייב מתן קרדיט והצגת נוסח הרישיון המקורי בלי לדרוש שיתוף תחת אותו רישיון. אפשר לאמן עליו מודלים לשימוש מסחרי וחופשי, אך נדרש לוודא שתנאי השימוש של מודל המקור GLM-5.1 אינם מגבילים אימון מודלים מתחרים על תוצריו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗