GPT
U

ultrafeedback_binarized

קוד פתוח

HuggingFaceH4mit2023-10-24

מאגר נתוני העדפות שעבר עיבוד כדי להתאים ישירות לאימון DPO, מודלי תגמול ושלבי SFT. הוא שימש במקור לאימון Zephyr-7B-beta ומספק זוגות של תשובות שנבחרו ונדחו על בסיס ציוני שופט.

  • 23,995הורדות בחודש
  • 345לייקים

מה זה

המאגר מבוסס על UltraFeedback המקורי של OpenBMB, שכלל שישים וארבעה אלף פרומפטים. לכל פרומפט הופקו ארבע תשובות ממגוון מודלים פתוחים ומסחריים, ומודל GPT-4 דירג אותן לפי מדדים של מועילות וכנות. בעיבוד הנוכחי, התשובה בעלת הציון הכולל הגבוה ביותר הוגדרה כתשובה הנבחרת, ואחת משלוש הנותרות נבחרה באופן אקראי כתשובה שנדחתה.

הנתונים מחולקים לשישה חלקים שנבנו עבור שלבי עבודה שונים. ישנם חלקי אימון ומבחן להעדפות שנועדו למידול תגמול או DPO, חלקי SFT שמשתמשים רק בתשובות הנבחרות כשיחות מלאות, וחלקי gen שמתאימים לדגימת דחייה או PPO. בחלוקות האימון יש 61,135 דוגמאות בכל אחת, ובחלוקות המבחן יש בין 1,000 ל־2,000 דוגמאות בהתאם למשימה.

מתאים ל

  • אימון DPO

    שימוש בעמודות התשובה הנבחרת והנדחית בחלוקת prefs כדי ליישר מודלי שפה.

  • אימון מודל תגמול

    לימוד מודל לדרג איכות של תשובות שונות לאותו פרומפט באנגלית.

  • כוונון עדין בהנחיה

    אימון SFT בעזרת עמודת messages בחלוקת sft שכוללת רק את התשובות המובילות.

  • דגימת דחייה

    שימוש בחלוקת gen לטכניקות יישור שמבוססות על סינון תשובות מרובות או PPO.

איפה זה נופל

המאגר מכיל נתונים בשפה האנגלית בלבד, כך שהוא לא יעזור לאימון ישיר של שיחות בעברית. בנוסף, הדירוג כולו התבצע על ידי GPT-4 ולא על ידי בני אדם, מה שמכניס את ההטיות וההעדפות הפנימיות של המודל השופט לתוך בחירת התשובות.

בעבר התגלו בו כמה מאות תיוגים שגויים, וכן דוגמאות שהגיעו מהמבחן TruthfulQA וגרמו לזליגת מידע מול לוחות מובילים ציבוריים. המפרסמים עדכנו את המאגר ותיקנו את שתי הבעיות, אך עדיין כדאי לבדוק מדגמית את איכות הפרומפטים והתשובות לפני שמבססים עליהם אימון למוצר.

שאלות
נפוצות

האם המאגר כולל שיחות בעברית?

לא, המאגר כולל נתונים בשפה האנגלית בלבד. אם המטרה שלכם היא מודל שמנהל שיחות בעברית, הנתונים כאן לא מתאימים בלי שתתרגמו או תתאימו אותם מראש.

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון שמופיע במאגר הוא רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה. הדרישה העיקרית היא לכלול את הודעת הרישיון המקורית ולצטט את המחקר המקורי.

מי קבע איזו תשובה נבחרה ואיזו נדחתה?

הסינון לא בוצע על ידי בני אדם אלא באמצעות מודל GPT-4 שנתן ציונים לארבע תשובות שונות לכל הנחיה. התשובה בעלת הציון הכולל הגבוה ביותר נבחרה, ואחת מהאחרות נבחרה באקראי כתשובה הנדחית.

מה ההבדל בין הגרסה הזו ל־UltraFeedback המקורי?

המאגר המקורי הכיל ארבע תשובות וציונים מפורטים לכל פרומפט. הגרסה הזו כבר עיבדה את המידע לזוגות של תשובה טובה ותשובה דחויה, וחילקה אותם מראש לקבצי parquet ייעודיים ל־SFT, DPO ו־PPO.

איך טוענים

טוענים את המאגר ישירות בעזרת פקודת load_dataset הרגילה של ספריית datasets עם המזהה HuggingFaceH4/ultrafeedback_binarized. המאגר ציבורי ופתוח לחלוטין, כך שאין צורך לבקש אישור גישה מוקדם או להגדיר מפתחות מיוחדים.

כל הקבצים שמורים בפורמט parquet יעיל ומחולקים מראש לקבצי אימון ומבחן עבור כל אחת משלוש המשימות. לפני שמתחילים לעבוד, שמים לב למבנה העמודות. העמודות chosen ו־rejected מכילות את זוגות התשובות לאימוני DPO, בעוד שעמודת messages מרכזת את רצף השיחה המלא ומתאימה לאימוני SFT או PPO.

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/ultrafeedback_binarized")

הרישיון

המאגר מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש חופשי, כולל שימוש מסחרי, שינוי הנתונים ואימון מודלים ללא דרישה להפיץ את התוצרים באותו רישיון. החובה היחידה היא לשמור על הודעת זכויות היוצרים ותנאי הרישיון המקוריים, ויש לצטט את המאמר המקורי של UltraFeedback.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗