GPT
U

ultrafeedback_binarized_cleaned

קוד פתוח

allenaimit2023-11-29

גרסה מסוננת ומנוקה של נתוני העדפות להשוואת תשובות של מודלי שפה. היא חוסכת לכם לכלוך ידוע וזיהום מבחנים עוד לפני שמתחילים לאמן.

  • 1,484הורדות בחודש
  • 72לייקים

מה זה

אלן אי איי לקחו את גרסת ההעדפות הבינאריות של אולטרה פידבק וניקו אותה בשני שלבים עיקריים. קודם כל הם העיפו החוצה פרומפטים שמקורם בטרוטפול קיו איי, כדי למנוע זיהום של מבחני ביצועים נפוצים. בנוסף, הם הסירו דוגמאות שנמצאו פגומות על ידי ארגילה, והוסיפו לכל רשומה תיוג של המקור שממנו היא הגיעה.

המאגר מחולק לקובצי פרקט שמיועדים לשלבי עבודה שונים. יש כאן חלוקה לנתוני אימון ובדיקה עבור העדפות, כלומר צמדי תשובות שנבחרו ונפסלו לאימוני יישור, לצד סטים נפרדים של נתוני אימון התנהגותי והפקה. המבנה הזה נותן לכם לבודד רשומות לפי מקור המידע ולסנן החוצה סוגי משימות שלא מתאימים לצרכים שלכם.

מתאים ל

  • אימון העדפות

    אימון של אלגוריתמי יישור כמו די פי או בעזרת צמדי תשובות מועדפות ונפסלות שכבר עברו ניקוי.

  • אימון התנהגותי

    שימוש בקובצי האימון הייעודיים לכוונון עדין של מודלי שפה על הנחיות מובנות.

  • הערכת ביצועים

    בדיקת איכות של מודלים מול סטי בדיקה שלא כוללים שאלות מתוך טרוטפול קיו איי.

איפה זה נופל

הכרטיס מציג רק את פעולות הניקוי ולא מפרט את השפות בפנים, כך שבפועל מדובר בנתונים שמבוססים על המקור באנגלית ולא מתאימים לעבודה בעברית. הנתונים פורסמו בסוף 2023 ומסתמכים על סינון אוטומטי וגילוי תקלות חיצוני, ולכן עדיין צריך לבדוק מדגמית את איכות התיוג לפני שמשתמשים בהם.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן, הרישיון שמדווח במאגר הוא אם איי טי. הרישיון הזה מתיר שימוש מסחרי מלא, כולל אימון מודלים שמשולבים במוצרים סגורים, בלי דרישה לחלוק את המודל הסופי תחת אותו רישיון.

האם יש כאן נתונים בעברית?

המאגר מבוסס על אולטרה פידבק המקורי שהוא באנגלית, והכרטיס לא מדווח על תמיכה בשפות אחרות. אם אתם מכוונים למודל שמדבר עברית טבעית, תצטרכו להביא נתונים מקומיים ממקור אחר.

מה ההבדל בין הגרסה הזו לגרסאות קודמות של אולטרה פידבק?

הגרסה הזו עברה סינון כפול. הורידו ממנה דוגמאות פגומות שארגילה מצאו, הסירו פרומפטים של טרוטפול קיו איי כדי למנוע דליפה למבחנים, והוסיפו עמודת מקור שמאפשרת סינון עצמאי.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטס דרך המזהה של אלן אי איי. הנתונים מגיעים בקובצי פרקט פתוחים לציבור בלי שום צורך לבקש אישור גישה מראש. שימו לב שיש כאן כמה פיצולים נפרדים כמו העדפות, אימון התנהגותי והפקה, ולכן צריך לבחור מראש את הקובץ המתאים במקום לטעון הכל כגוש אחד.

from datasets import load_dataset

ds = load_dataset("allenai/ultrafeedback_binarized_cleaned")

הרישיון

המאגר מופץ תחת רישיון אם איי טי, שזה הרישיון הכי מתירני שיש. אתם חופשיים להשתמש בו לצרכים פנימיים או מסחריים, לשנות אותו, ולאמן עליו מודלים חופשיים או קנייניים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗