GPT
W

WebInstructSub

קוד פתוח

TIGER-Labapache-2.02024-05-15

  • language model

מיליוני שאלות ותשובות מלוטשות מתחומי המדעים והמתמטיקה שנאספו ישירות מהרשת. המאגר מיועד למי שרוצה לשפר יכולות חשיבה ופתרון בעיות במודלים בלי להסתמך רק על דאטה סינתטי.

  • 10,529הורדות בחודש
  • 163לייקים

מה זה

המאגר מציע תת קבוצה מתוך פרויקט MAmmoTH2, הכוללת למעלה משני מיליון צמדי הוראה ותגובה שנאספו מפורומים מקוונים. תהליך הבנייה כלל איתור מסמכים מתוך Common Crawl, חילוץ שאלות ותשובות גולמיות, ועיבוד שלהן לגרסאות נקיות ומזוקקות שמתאימות לאימון מודלי שפה.

הנתונים מגיעים משלושה מקורות עיקריים. החלק הארי, 1,484,630 רשומות, מגיע מקהילת MathStackExchange ומתמקד במתמטיקה. חלק נוסף כולל 317,209 דוגמאות מקהילות מדעיות שונות ברשת סטאק אקסצ'יינג', ובהן פיזיקה, ביולוגיה, כימיה ומדעי המחשב. המקור השלישי תורם 533,384 רשומות מאתר Socratic ומכסה תחומים כמו מדעים, מתמטיקה ומדעי הרוח.

כל רשומה כוללת את השדות המקוריים orig_question ו־orig_answer לצד השדות המעובדים question ו־answer. המבנה הזה מאפשר לבחור אם לעבוד ישירות עם הניסוח המקורי מהפורום או עם הגרסה שעברה עידון והתאמה למשימות מענה על שאלות.

מתאים ל

  • כוונון מודלים במתמטיקה

    אימון מודלים על מיליון וחצי שאלות ופתרונות מתמטיים מפורטים מקהילות מקצועיות.

  • שיפור פתרון בעיות במדעים

    חיזוק יכולות המודל בתחומי הפיזיקה, הכימיה ומדעי המחשב בעזרת דיונים מעובדים.

  • מחקר על דאטה מהרשת

    השוואה בין השאלות והתשובות המקוריות לבין הגרסאות המעובדות כדי לנתח תהליכי סינון.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, כך שהוא לא יעזור ישירות למי שמאמן מודל לעברית. בנוסף, קיימת הטיה חזקה למתמטיקה ומדעים מדויקים, בעוד מדעי הרוח זוכים לייצוג נמוך יחסית. מדובר בדאטה שנאסף מפורומים פתוחים ברשת, ולמרות שלב הניקוי, ייתכנו שגיאות מהותיות בתשובות המקוריות שמשתמשים העלו. חובה לדגום את איכות המענה לפני שמשלבים אותו במערכות קריטיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רק בחלק מהנתונים. החלק שמקורו באתר Socratic מוגבל לשימוש לא מסחרי לפי רישיון CC BY-NC 4.0. אם אתם בונים מודל מסחרי, עליכם להסיר את הרשומות האלה ולהשתמש רק בנתונים שהגיעו מקהילות סטאק אקסצ'יינג'.

האם יש במאגר שאלות בעברית?

לא, המאגר כולו באנגלית. הוא מבוסס על פורומים דוברי אנגלית כמו MathStackExchange ו־Socratic. כדי לעבוד בעברית תצטרכו לתרגם את הנתונים או לפנות למקורות מקומיים.

באיזה פורמט הדאטה מגיע ואיך הוא בנוי?

הנתונים מגיעים בקובצי Parquet המחולקים ל־13 חלקים. כל שורה מכילה את השאלות והתשובות הגולמיות שחולצו מהרשת, לצד גרסאות מעובדות שעברו ניקוי לצורך אימון.

מאיפה הגיעו הנתונים שבמאגר?

החוקרים דלו דפים מתוך ארכיון Common Crawl וחילצו מהם דיונים מפורומים מקוונים. המקורות המרכזיים הם קהילות מתמטיקה ומדעים מתוך רשת סטאק אקסצ'יינג', לצד אתר הלמידה Socratic.

איך טוענים

הנתונים מפוצלים ל־13 קובצי Parquet ששמורים תחת תיקיית data, לצד קובץ README. אין צורך באישור גישה מיוחד כדי להוריד את המאגר מספריית הדאטהסטים. בזמן הטעינה כדאי לשים לב לשדות question ו־answer שהם הטקסטים המעובדים המיועדים ישירות לאימון, בעוד השדות המקוריים מתאימים בעיקר למי שרוצה לבצע סינון או ניתוח משלו.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/WebInstructSub")

הרישיון

המאגר מוגדר רשמית תחת apache-2.0, אך הכרטיס מפרט פיצול משפטי מהותי. הדאטה מסטאק אקסצ'יינג' זמין לכל מטרה כולל שימוש מסחרי בכפוף לתנאי אפאצ'י, אך 533,384 הרשומות מ־Socratic מוגבלות ברישיון CC BY-NC 4.0 לשימוש לא מסחרי בלבד. אימון מוצר מסחרי ידרוש מכם לסנן החוצה את הרשומות שמקורן באתר Socratic.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗