GPT
O

orca-math-word-problems-200k

קוד פתוח

microsoftmit2024-03-01

  • math

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מאגר של כמאתיים אלף שאלות מילוליות בחשבון עם פתרונות מפורטים. הוא מתאים למי שרוצה לשפר יכולות מתמטיות של מודלי שפה בלי ללקט שאלות לבד.

  • 24,338הורדות בחודש
  • 495לייקים

מה זה

המאגר כולל 200,035 רשומות שמיועדות לפתרון בעיות מתמטיות ברמה של בית ספר יסודי. כל רשומה פשוטה מאוד ומכילה שני שדות טקסט בלבד, שאלה ותשובה, בלי תיוגים נוספים, שלבי ביניים מופרדים או קטגוריות משניות. המבנה אחיד לכל אורך הדרך ונועד לאימון ישיר על צמדי קלט ופלט.

המקור לשאלות הבסיס מגיע מהמאגרים Lila ו־DMath. החוקרים של מיקרוסופט השתמשו בזרעים האלה והרחיבו את מאגר השאלות בעזרת Azure GPT-4 Turbo. גם כל התשובות והפתרונות הופקו מאותו מודל בדיוק, כך שמדובר בדאטה סינתטי לחלוטין שמבוסס על שאלות מקוריות שעברו הרחבה.

אין כאן חלוקה מובנית לחלקי אימון, בדיקה או ולידציה. כל 200,035 הדוגמאות יושבות יחד תחת חלוקת train בודדת, כך שאם אתם מתכננים להעריך את המודל ולא רק לאמן אותו, תצטרכו להפריד לעצמכם חלק מהנתונים בצד לפני שמתחילים.

מתאים ל

  • אימון מודלי שפה קטנים

    שיפור היכולת של מודלים קטנים לפתור בעיות חשבון ברמת יסודי.

  • אימון צמדי שאלות ותשובות

    כוונון עדין למודל שפה על פירוק של בעיה מילולית לשלבי פתרון.

  • בנצ'מרק להערכת מודלים

    מדידת יכולת ההסקה המתמטית של מודל קיים על שאלות מילוליות.

איפה זה נופל

החומר כולו באנגלית, בלי אף מילה בעברית או בשפות אחרות, וכולל אך ורק בעיות מילוליות בחשבון. אם תנסו ללמד מודל עברית בעזרתו, תצטרכו לתרגם הכל מראש. חיסרון מהותי נוסף הוא שכל התשובות וההרחבות יוצרו על ידי GPT-4 Turbo, ולכן טעויות לוגיות או הזיות קטנות שקיימות במודל המקור עשויות לחלחל פנימה. מיקרוסופט מדגישים בפירוש שהמאגר לא מיועד לשימוש במערכות חינוך אמיתיות, אז לא כדאי להכניס אותו כפתרון אוטומטי לתלמידים בלי בדיקה ידנית.

שאלות
נפוצות

מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן. הרישיון הוא MIT, וזה אומר שמותר להשתמש בנתונים לאימון מודלים מסחריים בלי הגבלה, כל עוד משאירים את הצהרת הרישיון והקרדיט של מיקרוסופט.

יש במאגר שאלות בעברית?

לא, הנתונים כולם באנגלית בלבד. אם המטרה היא לאמן מודל שיפתור בעיות מילוליות בעברית, תצטרכו לתרגם את השאלות והתשובות באופן עצמאי.

איך הנתונים נאספו ונבנו?

הבסיס מגיע מהמאגרים Lila ו־DMath. צוות המחקר של מיקרוסופט הרחיב את שאלות הבסיס ויצר את כל התשובות באמצעות Azure GPT-4 Turbo, כך שמדובר במידע סינתטי.

האם הדאטהסט מחולק למבחן ואימון מראש?

לא. כל 200,035 הרשומות נמצאות תחת חלוקת train אחת. אם רוצים למדוד ביצועים על נתונים שלא נלמדו, חייבים לפצל חלק מהרשומות לקבוצת בדיקה באופן יזום.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות המזהה של מיקרוסופט. הגישה פתוחה וציבורית לחלוטין, בלי צורך באישור, בטפסי בקשה או בטוקן מיוחד. הנתונים שמורים בקובץ parquet יחיד, מה שמבטיח קריאה מהירה ומשקל קובץ נמוך יחסית. ברגע שטוענים את החלוקה מקבלים Dataset עם השדות question ו־answer, ושניהם מחרוזות טקסט מוכנות לעבודה.

from datasets import load_dataset

ds = load_dataset("microsoft/orca-math-word-problems-200k")

הרישיון

המאגר מופץ תחת רישיון MIT, אחד הרישיונות הכי מתירניים שיש. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, לחלק אותו מחדש ולאמן עליו מודלים חופשי, בלי דרישה לשתף את המודל המאומן תחת אותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית של מיקרוסופט ונוסח הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗