GPT
D

distilabel-intel-orca-dpo-pairs

קוד פתוח

argillaapache-2.02024-01-07

גרסה מתוקנת של מאגר ההעדפות של אינטל לאימון DPO, שעברה הערכה מחדש עם מודל שופט. המאגר מציע ציונים והסברים לכל תשובה ומאפשר לסנן זוגות חלשים לפני תחילת האימון.

  • 18,720הורדות בחודש
  • 182לייקים

מה זה

המאגר מבוסס על orca_dpo_pairs המקורי של אינטל, שהכיל 12,859 דוגמאות ונבנה מתוך הנחה שתשובות GPT תמיד עדיפות. אנשי ארגילה העבירו את כל הזוגות שיפוט מחודש באמצעות gpt-4-turbo וכלי הניתוח distilabel, כדי להעריך את איכות התגובות באופן אובייקטיבי יותר.

הממצאים הראו שכ־4,000 זוגות הסתיימו בתיקו, בכ־7,000 זוגות התשובה המקורית אכן הייתה טובה יותר, ובכ-2,000 מקרים התשובה שנפסלה במקור הייתה למעשה עדיפה. הרשומות שונו בהתאם, כך שהתשובות הוחלפו במקומות הנדרשים, לצד שמירת המידע המקורי ועמודה שמסמנת חפיפה עם סט האימון של gsm8k.

מתאים ל

  • אימון העדפות DPO

    כוונון מודלי שפה פתוחים על זוגות תשובות מסוננים לפי סף איכות גבוה.

  • ניתוח החלטות שופט AI

    בדיקת הנימוקים והציונים של gpt-4-turbo מול בחירות אנושיות קודמות.

  • סינון דליפות מבחנים

    הסרת שאלות מתמטיות שמקורן ב־gsm8k כדי למנוע זיהום נתוני אימון.

איפה זה נופל

הדירוג וההסברים נוצרו במלואם על ידי gpt-4-turbo, כך שההטיות של מודלי שפה מסחריים קיימות בפנים. המאגר מתמקד באנגלית בלבד ואין בו התייחסות לעברית. בנוסף, מי שבוחר לאמן על כל הדאטהסט ללא סינון יכניס כ־4,000 זוגות שהוגדרו כתיקו, מה שעלול לפגוע בדיוק של אימון DPO.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי מלא. צריך לכלול את תנאי הרישיון והודעת זכויות היוצרים בקוד או במוצר.

מה ההבדל בינו לבין המאגר המקורי של אינטל?

המאגר המקורי הניח שתשובות GPT תמיד טובות יותר. כאן בוצע שיפוט חוזר שהחליף כ־2,000 זוגות שגויים, זיהה 4,000 מצבי תיקו והוסיף ציונים ונימוקים.

האם יש במאגר שאלות או תשובות בעברית?

לא, הנתונים הם באנגלית בלבד. אם אתם מכוונים למודל בעברית, תצטרכו לתרגם את הטקסטים או להשתמש במאגר אחר.

איך מומלץ לסנן את הנתונים לפני אימון?

המפתחים ממליצים להסיר רשומות בסטטוס תיקו, להשאיר ציון 8 ומעלה לתשובה הנבחרת, ולהחריג שאלות מ־gsm8k. סינון כזה מצמצם את המאגר ל־5,922 דוגמאות חזקות יותר.

איך טוענים

טוענים את הנתונים באמצעות ספריית datasets מפצל train יחיד, המאוחסן בקובץ parquet אחד. אין צורך בבקשת גישה מיוחדת או אישור מראש. השדות החשובים לסינון הם status, שמעיד אם הזוג הוחלף או הסתיים בתיקו, chosen_score שמאפשר לסנן תשובות נמוכות, ו־in_gsm8k_train שמציין 79 שאלות שמופיעות בסט האימון של gsm8k.

from datasets import load_dataset

ds = load_dataset("argilla/distilabel-intel-orca-dpo-pairs")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף נגזרות תחת אותו רישיון, ומודלים שאומנו עליו יכולים לשמש גם במוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗