GPT
U

Unified-Feedback

קוד פתוח

llm-blendermit2024-01-09

מאגר מאוחד של השוואות בין תשובות מודלים לצורך אימון מודלי תגמול ודירוג. הוא מרכז שמונה מקורות פידבק מוכרים לתוך מבנה נתונים אחיד.

  • 4,210הורדות בחודש
  • 18לייקים

מה זה

המאגר מאגד זוגות של שיחות לצורך השוואת איכות בין שתי תשובות שונות לאותו הקשר. כל רשומה כוללת מזהה ייחודי, שתי שיחות מלאות עם תפקידי משתמש ועוזר, ציון מספרי לכל שיחה שבו ערך גבוה יותר מעיד על עדיפות, מספר הסיבובים בשיחה ושם המקור המקורי.

הנתונים מגיעים משמונה מקורות שונים בעולם הפידבק וההעדפות האנושיות, ביניהם נתונים של אנתרופיק, אופן איי איי, אלטרה פידבק, נקטר וצ׳אטבוט ארנה. החלוקה בקבצים מסודרת לפי תתי תיקיות שמפרידות בין המקורות, כמו נקטר ואלטרה פידבק, לצד איחוד כולל שמכיל את כלל הדוגמאות ומחולק לחלקי אימון וולידציה.

מתאים ל

  • אימון מודלי תגמול

    לימוד מודל להבדיל בין תשובה טובה לפחות טובה על בסיס ציוני העדיפות שמופיעים בכל זוג שיחות.

  • אימון מודלי דירוג

    שימוש בקוד ההמרה הייעודי של המפרסמים כדי להכשיר מודל מסוג ראנקר לבחירת הפלט המוביל.

  • השוואת ביצועי תשובות

    בחינת איכות של מודלי שפה על גבי שיחות מרובות תורות ומקורות מידע מגוונים.

איפה זה נופל

הכרטיס לא מציין סינון של שפות, אך המקורות המרכיבים אותו מתמקדים באנגלית, כך שאין כאן מענה למי שבונה מודל ייעודי לעברית. בנוסף, המאגר מאחד מקורות שנוצרו בשיטות שונות לחלוטין, חלקם כוללים תיוג אנושי חי כמו ארנה וחלקם נשענים על דירוג סינתטי של מודלים חזקים. הדירוגים עצמם אינם מנורמלים לטווח אחיד ורק שומרים על הכלל שערך גבוה עדיף, מה שמחייב בדיקה והתאמה של הנתונים לפני שמריצים עליהם תהליך אימון עיוור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון של המאגר עצמו הוא MIT ולכן הוא מתיר שימוש מסחרי מלא. יחד עם זאת, הנתונים הורכבו משמונה מאגרים נפרדים, ולכן יש לוודא שהרישיונות של מקורות המקור אינם מגבילים שימוש מסחרי.

האם יש במאגר שיחות בעברית?

התיעוד אינו מציין תמיכה בעברית. רוב מוחלט של הנתונים נשען על מקורות מחקר מובילים באנגלית, ולכן אינו מתאים למי שמחפש לכוונן מודלים לשפה העברית.

איך נאספו הדוגמאות שבפנים?

היוצרים איחדו שמונה סטים קיימים של השוואות פידבק, ביניהם נתונים של אנתרופיק, ארגילה וברקלי. הם המירו את כל המקורות למבנה סכמה אחיד שכולל את תורות השיחה והציונים היחסיים.

מה שונה כאן משימוש במאגרים המקוריים בנפרד?

במקום להוריד ולבצע התאמות מבנה לכל מאגר פידבק לחוד, כאן כל הנתונים מנורמלים לאותו פורמט של שיחה א ושיחה ב. זה חוסך עבודת ניקוי והתאמה ומאפשר אימון ישיר על שילוב של כמה מקורות.

איך טוענים

הנתונים שמורים בקובצי פרקט ומחולקים לתיקיות לפי מקור ולתיקייה כוללת. אין צורך לבקש אישור גישה כדי להוריד אותם, ואפשר לטעון את הקבצים ישירות דרך ספריית הדאטהסטס הרגילה. המבנה הפנימי מחזיק את השיחות כמערכים של הודעות, כך שכדי להשתמש בהם לאימון יש לחלץ את התור האחרון של העוזר מול פלט המשתמש, או להיעזר בסקריפט ההמרה שהיוצרים שיתפו בגיטהאב כדי להתאים את המבנה לפורמט של מודלי דירוג.

from datasets import load_dataset

ds = load_dataset("llm-blender/Unified-Feedback")

הרישיון

המאגר מפורסם תחת רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה ללא דרישה לשיתוף תחת אותו רישיון ומחייב רק מתן קרדיט. עם זאת, מכיוון שהנתונים נאספו משמונה מקורות חיצוניים שונים, חובה לבדוק בנפרד את תנאי השימוש של כל מקור מקורי לפני שמשלבים מודל שאומן עליהם במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗