GPT
O

orpo-dpo-mix-40k

קוד פתוח

mlabonneapache-2.02024-04-17

  • dpo
  • rlhf
  • preference
  • orpo

אוסף מסונן של זוגות העדפה לאימון מודלים, שנועד לחסוך איסוף ידני מכמה מקורות מוכרים. הוא מרכז תשובות איכותיות לצד דוגמאות שנפסלו כדי לכוונן התנהגות בצורה יעילה.

  • 1,143הורדות בחודש
  • 309לייקים

מה זה

המאגר מורכב משבעה מקורות שונים של זוגות העדפה, ביניהם קפיברה, אולטרה-פידבק, נתוני מתמטיקה של דיסטילייבל ודוגמאות של אנ-אליינמנט. החלק הארי נלקח מגרסאות מנוקות של ארגילה, כאשר לכל מקור הוגדר רף ציון מינימלי מחמיר לתשובה המועדפת, כמו ציון חמש ומעלה או תשע ומעלה, כדי לוודא שרמת התוכן תהיה גבוהה. בנוסף הוחרגו שאלות שחפפו למבחן GSM8K כדי למנוע זיהום נתונים.

מעבר לסינון לפי ציונים, הופעל סינון מבוסס כללים שמחק מעל אלפיים דוגמאות שכללו ניסוחים טיפוסיים מדי למודלים של OpenAI בתשובה המועדפת. המבנה הפנימי שונה בגרסה העדכנית כך שנוספה עמודת שאלה ייעודית, במטרה לתמוך ישירות בהרצה דרך אקסולוטל בלי צורך בעיבוד מקדים של השיחות.

מתאים ל

  • אימון מודל בשיטת ORPO

    כוונון ישיר של מודלי שפה על זוגות העדפה באנגלית כדי לשפר דיוק ותשובות.

  • אימון העדפות בשיטת DPO

    שימוש בזוגות של בחירה ודחייה ליישור התנהגות המודל לפי ציוני איכות.

  • סינון והרכבת מאגר מותאם

    חיתוך שורות לפי עמודת המקור כדי לבודד תחומי מתמטיקה או תשובות מסוכנות.

איפה זה נופל

המאגר כולו באנגלית ואין בו שום תוכן בעברית. לא הייתי משתמש בו למוצר ישראלי שמחייב שיחה מקומית או הבנת הקשר תרבותי בלי אימון מקדים משמעותי. מעבר לזה, נכללו בו כחמש מאות דוגמאות שמטרתן לעודד מענה על שאלות לא חוקיות, שמקורן בחבילת רעילות מכוונת. מי שבונה מוצר מסחרי שדורש בטיחות וסינון חייב לסנן את שורות המקור האלו החוצה בקוד לפני האימון, אחרת המודל עלול לספק תשובות שפוגעות בכללי השימוש שלכם.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד. אם אתם צריכים לכוונן מודל שמיועד למשתמשים בישראל, תצטרכו לתרגם את הנתונים או להשתמש במקורות אחרים.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן, הרישיון הוא אפאצ'י שתיים אפס שמאפשר שימוש מסחרי מלא. רק שימו לב שחלק מהנתונים הגיעו ממקורות סינתטיים של מודלים אחרים, מה שעשוי לדרוש בדיקה משפטית נוספת מול תנאי השימוש של אותם מודלים.

איך מסירים את התוכן המסוכן מהאימון?

הכרטיס מציג פקודת פילטר פשוטה בפיטון שמסננת רשומות שבהן עמודת המקור שווה למאגר הרעילות. מומלץ להריץ את השורה הזו לפני שמתחילים את האימון בפועל.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס הרגילה בפיטון מתוך הפיצול היחיד של האימון. הקובץ שמור בפורמט פארקט יחיד ופתוח להורדה מיידית בלי צורך בטופסי גישה או אישור מיוחד. המבנה כולל עמודת שאלה, תשובה נבחרת, תשובה שנדחתה ושדה מקור שמציין מאיזה תת מאגר השורה הגיעה. אם מאמנים באמצעות אקסולוטל לתהליך של ORPO, מגדירים את הנתיב ישירות עם תבנית צ'אט מתאימה. לעומת זאת, למי שמריץ DPO קלאסי, היוצר עצמו ממליץ לפנות לגרסה השטוחה של המאגר שמותאמת יותר למבנה הזה.

from datasets import load_dataset

ds = load_dataset("mlabonne/orpo-dpo-mix-40k")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס, שמתיר שימוש מסחרי, שינוי והפצה בלי לחייב פתיחת קוד של מודל שאומן עליו. חובה רק לשמור על תנאי הייחוס והודעת הרישיון המקורית בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗