GPT
S

stack-exchange-preferences

קוד פתוח

HuggingFaceH4cc-by-sa-4.02023-02-11

  • RLHF
  • preferences
  • human-feedback
  • Stack Exchange

מאגר שאלות ותשובות עצום מרשת סטאק אקסצ'יינג' שנבנה במיוחד לאימון מודלי העדפה. היתרון הגדול שלו הוא דירוג איכות מובנה לכל תשובה שמבוסס על הצבעות הקהילה.

  • 11,539הורדות בחודש
  • 135לייקים

מה זה

הנתונים נלקחו ישירות ממאגר הנתונים הציבורי של סטאק אקסצ'יינג' ועברו סינון קפדני. המפתחים השאירו אך ורק שאלות שיש להן לפחות שתי תשובות שונות, בהתאם לשיטה המחקרית של חברת אנתרופיק. לכל תשובה מוצמד ציון מספרי שמחושב לפי לוגריתם של כמות ההצבעות החיוביות, עם תוספת נקודה אם השואל סימן אותה כתשובה הנבחרת, ומינוס אחת לתשובות שקיבלו הצבעות שליליות.

המאגר כולל מעל עשרה מיליון הוראות והוא מחולק לתיקיות לפי האתרים השונים ברשת, החל מסטאק אוברפלו המרכזי ועד לפורומים קטנים יותר כמו הדפסה בתלת מימד. בסך הכל ישנם 762 קבצים בפורמט פארקט, מה שמאפשר לטעון רק קהילות ספציפיות שמעניינות אתכם בלי למשוך את כל המאגר בבת אחת.

מתאים ל

  • אימון מודלי העדפה

    יצירת זוגות של תשובה טובה מול רעה לפי הצבעות הקהילה לשלב הדירוג.

  • אימון מודלים להוראות

    שימוש בשאלות ובתשובות המקובלות כדוגמאות אימון למענה על פניות.

  • מענה על שאלות תכנות

    בניית מנוע ידע טכני המבוסס על מיליוני הדיונים שקיימים באתר המקורי.

איפה זה נופל

הנתונים מיועדים לאנגלית בלבד, וקהילות שלמות בשפות כמו ספרדית, פורטוגזית, רוסית ויפנית הוסרו החוצה. עברית לא קיימת כאן בכלל אלא אם מישהו כתב מילה אקראית בתוך שאלה טכנית. בעיה נוספת היא שחלק מהתשובות מקבלות ציונים זהים, כך שתצטרכו לסנן אותן בעצמכם כדי שלא לבלבל את המודל. בנוסף, מדובר בהצבעות אנושיות מפורומים, ולכן הטיות של פופולריות ותשובות שנראות טוב אך אינן נכונות עדיין קיימות בפנים.

שאלות
נפוצות

האם יש תמיכה בעברית?

לא, המאגר מכיל אנגלית בלבד. קהילות בשפות אחרות הושמטו במכוון במהלך איסוף הנתונים, ולכן הוא אינו מתאים לפרויקטים בעברית.

האם מותר להשתמש בו לצרכים מסחריים?

כן, אך הרישיון דורש שיתוף תחת אותו רישיון ומחייב ייחוס קפדני מאוד. עליכם לקשר לכל שאלה ולכל פרופיל משתמש שמופיע בתוצרים, מה שמסבך מאוד הטמעה במוצר סגור.

כמה מקום צריך לפנות בדיסק?

ההורדה דורשת 22.13 גיגה בייט של קובצי פארקט. אם תרצו לייצר זוגות בינאריים לאימון העדפות באמצעות הסקריפט, תצטרכו להקצות מקום נוסף לקבצים המעובדים.

איך נאספו וסוננו הנתונים?

הנתונים נלקחו ישירות מארכיון הנתונים הציבורי של סטאק אקסצ'יינג'. המפתחים סיננו את כל השאלות שאין להן לפחות שתי תשובות, וחישבו לכל תשובה ציון ייעודי המבוסס על כמות ההצבעות וקבלת התשובה על ידי השואל.

איך טוענים

כדי להתחיל לעבוד צריך להוריד נפח של 22.13 גיגה בייט. הקבצים שמורים בפורמט פארקט ואין צורך בבקשת גישה מיוחדת, המאגר פתוח לכולם. השדות החשובים ביותר הם השאלות, התשובות והציון המחושב לכל תשובה. אם המטרה היא אימון מודל העדפה, היוצרים לא חילקו את הנתונים לזוגות בינאריים מראש בגלל מגבלות רישיון, אלא צירפו סקריפט ייעודי שמבצע את החלוקה הזו מקומית לפני האימון.

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/stack-exchange-preferences")

הרישיון

הרישיון הוא סי סי בי אס איי 4.0, והוא מתיר שימוש מסחרי אך מטיל חובות ייחוס כבדות ושיתוף תחת אותו רישיון בדיוק. אתם חייבים להציג קרדיט לרשת סטאק אקסצ'יינג', לכלול קישורים ישירים לשאלות המקוריות ולפרופיל של כל כותב, ללא שימוש בהפניות או חסימת מנועי חיפוש. בגלל דרישת השיתוף הזהה, הפצת מודל שאומן על הדאטהסט עלולה לחייב אתכם לפתוח אותו תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗