GPT
U

UltraFeedback

קוד פתוח

openbmbmit2023-09-23

מאגר העדפות ענק שנועד לאימון מודלי תגמול וביקורת, עם כרבע מיליון תשובות מרובות מודלים שדורגו באמצעות בינה מלאכותית לפי קריטריונים ברורים.

  • 14,224הורדות בחודש
  • 435לייקים

מה זה

המאגר מכיל 63,967 הוראות שנאספו משישה מקורות ציבוריים מוכרים, ביניהם פלאן, שר ג'יפיטי, אבול אינסטרקט, אולטרה צ'אט, טרות'פול קיו איי ופולס קיו איי. החוקרים לקחו את כל השאלות ממאגרי האמת והשקר, ודגמו אלפי רשומות מכל שאר המקורות כדי לייצר גיוון רחב במשימות.

עבור כל הוראה נבחרו באקראי ארבעה מודלי שפה מתוך מאגר של 17 ארכיטקטורות שונות, כולל גרסאות של לאמה, מודלים מסחריים כמו ג'יפיטי 4 ובארד, ומודלים פתוחים כמו פלקון או סטאר צ'אט. לכל מודל הוצמד עיקרון פעולה ספציפי בפרומפט המערכת, כמו מועילות או כנות, כדי לעודד סגנונות מענה שונים.

התוצאה היא 256 אלף תשובות שקיבלו כ־380 אלף ציונים ומשובים טקסטואליים מפורטים מג'יפיטי 4. הדירוג בודק ארבעה ממדים שונים: דיוק במילוי ההוראה, אמיתות, כנות ומידת העזרה, מה שמאפשר לבנות סביב מיליון זוגות השוואה לצורכי אימון העדפות.

מתאים ל

  • אימון מודל תגמול

    בניית זוגות השוואה מהדירוגים כדי ללמד מודל להעריך איכות תשובות בתהליכי יישור.

  • פיתוח מודל ביקורת

    שימוש במשוב הטקסטואלי של ג'יפיטי 4 כדי ללמד מודל לנמק פגמים בתשובות.

  • מחקר הטיות שיפוט

    ניתוח האופן שבו שופט אוטומטי מעריך מודלים מסחריים מול מודלים פתוחים.

איפה זה נופל

החולשה העיקרית והמוצהרת כאן היא ההסתמכות המוחלטת על ג'יפיטי 4 כשופט יחיד. המודל שוגה לפעמים, מייצר הטיות סגנוניות משלו ומחלק ציונים לא מדויקים. המאגר נבנה באנגלית בלבד, ואין בו שום ייצוג לעברית או להקשרים מקומיים. בנוסף, הנתונים הוקפאו בספטמבר 2023, כך שהתשובות מבוססות על מודלים בני אותה תקופה ולא משקפות יכולות של מנועים עדכניים יותר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא רישיון MIT חופשי שמתיר שימוש מסחרי, שינוי והפצה. אם אתם מאמנים עליו מודל כדי למכור גישה אליו, הרישיון של המאגר עצמו לא עוצר אתכם, אם כי תמיד יש לקחת בחשבון שחלק מהפרומפטים הגיעו משירותים מסחריים.

האם הדאטהסט כולל שאלות או תשובות בעברית?

לא. המאגר מוגדר לדוברי אנגלית בלבד וכל השאלות והתשובות שבו נאספו ונכתבו באנגלית. כדי להשתמש בו למוצרים בעברית תצטרכו לתרגם את הנתונים או להשתמש בו לאימון מודל רב לשוני שכבר מכיר את השפה.

מי דירג את התשובות והאם בני אדם עברו עליהן?

הדירוג כולו סינתטי ובוצע על ידי ג'יפיטי 4 לפי הנחיות מפורטות בארבעה ממדים שונים. לא היה כאן תיוג אנושי ידני על 256 אלף התשובות, כך שהאיכות והדיוק תלויים לחלוטין ביכולת השיפוט של המודל המתייג.

איך הנתונים מאורגנים בתוך המאגר?

הנתונים מחולקים למספר קבצי ג'ייסון לפי מקור הדגימה המקורי של ההוראות, למשל קובץ נפרד לשאלות מפלאן, קובץ לשר ג'יפיטי וקובץ לטרות'פול קיו איי. כל רשומה כוללת את ההוראה המקורית, ארבע תשובות ממודלים שנבחרו באקראי ואת המשוב המפורט שנרשם עבורן.

איך טוענים

הנתונים מחולקים לקבצי ג'ייסון לפי מקור ההוראה, כמו פלאן, שר ג'יפיטי ואחרים, וזמינים להורדה ישירה דרך ספריית הדאטהסטס הרגילה בלי צורך בטופסי הרשמה או אישור גישה. לפני שמתחילים לרוץ כדאי לשים לב למבנה הרשומות, שמחזיק בכל שורה את הפרומפט המקורי, ארבע התשובות מהמודלים השונים, והמשובים המילוליים והמספריים שנתן השופט.

from datasets import load_dataset

ds = load_dataset("openbmb/UltraFeedback")

הרישיון

המאגר מופץ תחת רישיון MIT, מה שנותן חופש כמעט מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, ולאמן עליו מודלים פנימיים או מוצרים שמוכרים ללקוחות, בלי חובת שיתוף של הקוד שלכם, כל עוד שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗