GPT
M

Maths-College

קוד פתוח

ajibawa-2023apache-2.02024-05-08

  • Maths
  • Mathematics
  • Probability
  • Statistics
  • Liner Algebra

מאגר הוראות באנגלית ברמה אקדמית שמכיל קרוב למיליון דוגמאות במתמטיקה. הוא פונה למי שרוצה לאמן מודלים על תחומים מתקדמים כמו אלגברה מופשטת, טופולוגיה וחדו"א.

  • 305הורדות בחודש
  • 54לייקים

מה זה

המאגר כולל קרוב למיליון רשומות במבנה של הוראות בפורמט JSON, שמחולקות בין שישה קבצים מרכזיים. התוכן מכסה מגוון רחב של תחומים ממתמטיקה ברמה אוניברסיטאית ומדעי המחשב התיאורטיים, כולל הסתברות, סטטיסטיקה, אלגברה לינארית, חדו"א, משוואות דיפרנציאליות, תורת החבורות, טופולוגיה, תורת הגרפים, קומבינטוריקה, אלגוריתמים ומבני נתונים.

למרות הכמות הגדולה, כרטיס המאגר לא מפרט מאיפה הנתונים נאספו בפועל, האם הם נוצרו על ידי מודלים אחרים או נלקחו מספרי לימוד, ואיזה סינון או בקרת איכות נעשו עליהם. אין כאן חלוקה מוגדרת מראש לסט אימון, ולידציה או מבחן, כך שכל הפיצול והבדיקות נופלים עליכם לפני שמתחילים לעבוד.

מתאים ל

  • אימון הוראות מתמטי

    כוונון מודלים בסיסיים כדי שידעו לפתור תרגילים מורכבים באלגברה, חדו"א וטופולוגיה באנגלית.

  • מענה לשאלות באלגוריתמים

    שיפור היכולת של מודל להתמודד עם שאלות תיאורטיות במבני נתונים ובאלגוריתמיקה אקדמית.

  • הערכת ביצועים מותאמת

    בניית מבחני הערכה פנימיים למודלים על תחומי מתמטיקה מתקדמים, אחרי סינון ידני של החומר.

איפה זה נופל

הבעיה המרכזית היא חוסר השקיפות. הכרטיס לא מציין מאיפה התוכן הגיע, מה שאומר שאין דרך לדעת אם יש שם שגיאות מתמטיות, הזיות של מודל שייצר אותם או בעיות זכויות יוצרים של חומרי לימוד. בנוסף, הכל באנגלית בלבד, ואין שום נתונים בעברית. לפני שאתם מאמנים על זה מודל שפותר בעיות, חובה לדגום ידנית כמה עשרות דוגמאות ולוודא שהתשובות בכלל נכונות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמאפשר שימוש מסחרי חופשי. אתם לא מחויבים לפתוח את הקוד של המודל שלכם, כל עוד אתם כוללים את תנאי הרישיון המקורי והודעת הזכויות של היוצר.

האם יש בדאטהסט תמיכה בעברית?

לא, כל הנתונים מוגדרים תחת השפה האנגלית בלבד. אם המטרה היא לפתור שאלות מתמטיות בעברית, תצטרכו לתרגם את השאלות או להשתמש בו לאימון מודל רב-לשוני שיודע לגשר על הפער.

איך נאסף המידע שבקבצים?

היוצר לא שיתף שום פרט על מקור הנתונים או על תהליך האיסוף והניקוי. בגלל שאין תיעוד למקור, אי אפשר לדעת מראש אם מדובר בטקסטים שנוצרו על ידי בינה מלאכותית או בחומרים שנלקחו ממקורות אחרים.

איך טוענים

הנתונים יושבים בשישה קבצי JSON נפרדים תחת השמות Maths-College-0-Final.json עד Maths-College-5-Final.json, לצד קובץ README. הגישה חופשית לגמרי ואין צורך לבקש הרשאות מיוחדות. אפשר לטעון אותו ישירות דרך ספריית datasets או להוריד את הקבצים ידנית, אבל תצטרכו לכתוב סקריפט קצר שיאחד את החלקים ויבדוק את שמות המפתחות בתוך ה־JSON לפני ההזנה למודל.

from datasets import load_dataset

ds = load_dataset("ajibawa-2023/Maths-College")

הרישיון

המאגר פורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המידע והפצה שלו, ואינו מחייב אתכם לשחרר מודלים שאימנתם תחת אותו רישיון. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗