GPT
O

OpenHermesPreferences

קוד פתוח

argillaother2024-02-22

  • synthetic
  • rlaif
  • dpo
  • distilabel

בערך מיליון זוגות של העדפות בינאריות סינתטיות ליישור מודלים. הוא מיועד למי שרוצה לאמן מודל תגמול או להריץ DPO בלי להסתמך רק על פידבק אנושי יקר.

  • 831הורדות בחודש
  • 214לייקים

מה זה

המאגר מבוסס על הדאטהסט המקורי OpenHermes-2.5 של teknium, ומכיל שורות שכוללות שיחה עם פלט מועדף מול פלט דחוי. עבור כל הנחיה נלקחו תשובות מהמקור, יחד עם תשובות חדשות שיצרו שני מודלים פתוחים: Mixtral-8x7B-Instruct-v0.1 ו־Nous-Hermes-2-Yi-34B. הדירוג עצמו לא נעשה בידי אדם אלא על ידי מודל שקלול ייעודי בשם PairRM שקבע מי התשובה הטובה יותר בכל זוג.

בחלוקה הפנימית לפי מקורות ההנחיות, הדאטה נוטה בכבדות לתחום הקוד. 36.31 אחוזים מהמקרים מגיעים מ־glaive-code-assist. שאר המאגר מורכב מתת-מאגרים מוכרים אחרים, כולל CamelAI עם 15.62 אחוזים, metamath עם 11.25 אחוזים, EvolInstruct_70k עם 10.34 אחוזים, ונתחים קטנים יותר מ־cot_alpaca_gpt4, airoboros ומאגרים נוספים. התפלגות התשובות שנבחרו ונפסלו די מאוזנת בין שלושת המודלים, אם כי מיקסטרל מוביל במעט במספר הבחירות החיוביות עם קרוב ל־394 אלף מקרים.

מתאים ל

  • אימון מודל תגמול

    אימון מודל שמעריך איכות של תשובות טקסט לצורך תהליכי RLHF עתידיים.

  • יישור מודלים ב־DPO

    הרצת Direct Preference Optimization על מודל שפה כדי לשפר את איכות השיחה שלו באנגלית.

  • התמחות בהעדפות לקוד

    סינון לפי glaive-code-assist לאימון יישור ממוקד למשימות תכנות.

איפה זה נופל

הבעיה המרכזית היא הטיית אורך מובהקת. הכרטיס מודה במפורש שלמודל המדרג יש נטייה להעדיף תשובות ארוכות יותר, מה שגרם לו לבחור לעיתים קרובות בתשובות המפורטות והנמרחות של מיקסטרל במקום בתשובות קצרות וישירות. אימון מודל על הנתונים האלה עלול ללמד אותו לייצר פלט ארכני יתר על המידה.

בנוסף, כל המאגר באנגלית בלבד ואין בו שום נתונים בעברית. מדובר בדאטה סינתטי לחלוטין שמבוסס על דירוג של מודל אחר, ללא שום אימות אנושי בפועל. לפני אימון למוצר סופי, יש לבדוק שההעדפות אינן מתגמלות הזיות ארוכות ומנומקות על פני תשובות מדויקות ותמציתיות.

שאלות
נפוצות

האם יש בדאטהסט טקסטים בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד, ואינו מתאים לאימון יכולות שפה בעברית.

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון מוגדר כ־other ולכן אין היתר שימוש מסחרי מפורש בכרטיס. יש לבדוק את תנאי המודלים שיצרו את הדאטה ואת הרישיון המקורי של OpenHermes-2.5 לפני שימוש מסחרי.

איך נקבע איזה פלט הוא הטוב יותר?

הבחירה בין chosen ל־rejected לא נעשתה על ידי בני אדם. התשובות יוצרו על ידי שלושה מודלים שונים ודורגו באופן אוטומטי על ידי מודל שקלול בשם PairRM.

מה הפורמט שבו המאגר מגיע?

הדאטה מגיע בפורמט parquet ומחולק ל־16 קבצים תחת ספליט של train. הטעינה מתבצעת ישירות דרך פקודת load_dataset הרגילה של Hugging Face.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה datasets של Hugging Face ללא צורך בהרשאות מיוחדות. הנתונים מחולקים על פני 16 קובצי parquet, מ־00000 עד 00015, כולם תחת ספליט ה־train. השדות המרכזיים בכל רשומה הם chosen ו־rejected שמכילים את היסטוריית השיחה המלאה. מומלץ להחיל את ה־chat template הרלוונטי למודל היעד לפני האימון. אם צריך להתמקד בתחום ספציפי כמו מתמטיקה או תכנות, מומלץ לסנן את הרשומות לפי השדה source.

from datasets import load_dataset

ds = load_dataset("argilla/OpenHermesPreferences")

הרישיון

הרישיון של המאגר מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי. ההגדרה הזו לא מספקת מידע ברור לגבי שימוש מסחרי, ייחוס או דרישות שיתוף. מאחר שמדובר בשילוב של נתוני מקור ופלט ממספר מודלים שונים, מעמדו המשפטי של מודל שיאומן עליו אינו מוגדר ואי אפשר להסתמך עליו בסביבה מסחרית ללא בדיקה משפטית פרטנית.

הרישיון המלא ב־Hugging Face ↗