GPT
D

dpo-mix-7k

קוד פתוח

argillamit2024-01-30

  • distilabel
  • synthetic
  • dpo
  • argilla

אוסף קטן וממוקד של העדפות לאימון DPO, שנבנה משלושה מקורות שונים. הוא כולל רק תשובות שקיבלו ציונים גבוהים במיוחד, במטרה לספק איכות במקום נפח עצום.

  • 1,199הורדות בחודש
  • 176לייקים

מה זה

המאגר מכיל דגימות שנועדו לכוונון מודלים בשיטת Direct Preference Optimization. כל רשומה כוללת העדפה בין שתי תשובות, כאשר הדגש כאן הוא על סינון קפדני של התשובה הנבחרת, כדי להבטיח שרמת הפלט שתלמדו ממנה תהיה גבוהה באמת.

ארגילה הרכיבו את התערובת הזו בעזרת הכלי distilabel משלושה מאגרים קיימים שלהם, בחלוקה שווה של בערך שליש מכל מקור. החלקים מגיעים מגרסאות מעובדות של UltraFeedback, Intel Orca ו־Capybara, כאשר מכל מאגר נלקחו רק דגימות שבהן התשובה המועדפת עברה רף ציון מסוים, כמו ציון שמונה ומעלה באורקה או ארבע ומעלה באחרים. עמודת מקור מציינת מאיזה מאגר הגיעה כל שורה.

מתאים ל

  • אימון העדפות מהיר

    כוונון מודל בשיטת DPO על סט נתונים קטן ואיכותי יחסית, בלי לבזבז ימי חישוב יקרים.

  • בדיקת תהליכי יישור

    הרצת בדיקות שפיות ובנצ'מרקים לתהליך האימון שלכם לפני מעבר למאגרים של מאות אלפי שורות.

  • מחקר על שילובי דאטה

    בחינה של השפעת שילוב מקורות שונים כמו אורקה וקפיברה על התנהגות הפלט הסופי של המודל.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שלמי שמחפש לכוונן מודל בעברית אין מה לעשות פה בלי תרגום מלא. בנוסף, מדובר במדגם אקראי מתוך מקורות מסוננים בלי אופטימיזציה מתקדמת למגוון או מורכבות, עניין שהיוצרים עצמם ציינו שיש לשפר בהמשך. שווה לבדוק את טיב התשובות בעצמכם לפני שאתם שופכים על זה שעות GPU יקרות.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, המאגר מפורסם תחת רישיון MIT שמתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים פנימיים או מוצרים שיוצאים ללקוחות, כל עוד אתם שומרים על תנאי הייחוס של הרישיון.

האם יש בדאטהסט הזה תוכן בעברית?

לא, המאגר כולל טקסטים בשפה האנגלית בלבד. אם המטרה שלכם היא מודל שמבין או מייצר עברית, הנתונים האלה לא יעזרו לכם באופן ישיר.

איך נאספו הנתונים שבפנים?

היוצרים אספו מדגם אקראי משלושה מאגרי DPO קיימים שיצרו בעזרת distilabel. הם סיננו החוצה דוגמאות חלשות והשאירו רק רשומות שבהן התשובה הנבחרת קיבלה ציון איכות גבוה במיוחד.

באיזה פורמט המידע מגיע וכמה הוא כבד?

הנתונים יושבים בקובצי Parquet בסיסיים, אחד לאימון ואחד לבדיקה, לצד קובץ הסבר. מדובר במאגר קטן של אלפי רשומות בודדות, כך שהורדה וטעינה שלו לוקחות שניות בודדות.

איך טוענים

הנתונים שמורים בפורמט Parquet ומחולקים לקובץ אימון וקובץ בדיקה, כך שאפשר לטעון אותם מיד עם ספריית datasets של Hugging Face בלי שום צורך לבקש אישור גישה מראש. הקבצים קלים ומוכנים לעבודה ישירה. בעת העבודה כדאי לשים לב לעמודת המקור כדי לעקוב אחרי האיזון בין שלושת המאגרים השונים בזמן הריצה.

from datasets import load_dataset

ds = load_dataset("argilla/dpo-mix-7k")

הרישיון

המאגר מופץ תחת רישיון MIT. מדובר ברישיון מתירני שמאפשר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו רישיון. כל מה שנדרש מבחינה חוקית הוא שמירת הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗