GPT
D

distilabel-capybara-dpo-7k-binarized

קוד פתוח

argillaapache-2.02024-01-26

  • Physics
  • Biology
  • Math
  • Chemistry
  • Culture

מאגר העדפות לשיחות מרובות תורות שנועד לאימון DPO בקוד פתוח. הפרויקט מדרג תשובות מתחרות לשיחות מורכבות כדי לשפר מודלים פתוחים בניהול דיאלוגים ארוכים.

  • 20,097הורדות בחודש
  • 184לייקים

מה זה

המאגר מבוסס על שלד השיחות של LDJnr/Capybara, שכולל דיאלוגים מרובי שלבים בין משתמש לעוזר. לכל שיחה נלקחה היסטוריית ההודעות, ועבור התור האחרון של העוזר הופקו תשובות מתחרות באמצעות שלושה מודלי קוד פתוח בגודל שבעה מיליארד פרמטרים: Notus7B, NeuralBeagle ו־OpenHermes-2.5, לצד התשובה המקורית שכבר הייתה קיימת בדאטהסט.

ארבע התשובות לכל דיאלוג דורגו בעזרת כלי distilabel ומודל gpt-4-turbo ששימש כשופט איכות. הרשומות מחולקות לזוגות של תשובה מועדפת (chosen) ותשובה דחויה (rejected) בפורמט השיחות המוכר, כשהדירוג המקורי נע על סולם של אחת עד חמש. הקובץ מכיל חלוקת אימון יחידה עם כמה אלפי רשומות, ויוצרי המאגר עצמם ממליצים לסנן החוצה שיחות ארוכות מדי או דוגמאות שבהן התשובה הנבחרת קיבלה ציון נמוך מארבע.

מתאים ל

  • אימון DPO לשיחות

    כוונון מודלי שפה על דיאלוגים מרובי שלבים כדי למנוע הידרדרות בתשובות בהמשך השיחה.

  • שילוב בתערובות העדפה

    ערבוב עם דאטהסטים אחרים לאימון העדפות כללי של מודלי שבעה מיליארד פרמטרים.

  • הערכת שופטי LLM

    בדיקת ההתאמה בין ציוני איכות אוטומטיים לבין הדירוגים שנתן gpt-4-turbo.

איפה זה נופל

הנתונים כולם באנגלית, בלי שום ייצוג לעברית או לשפות אחרות. השיפוט מבוסס לחלוטין על gpt-4-turbo, מה שמכניס את ההטיות המובנות של OpenAI לגבי סגנון, אורך ותוכן. היוצרים מציינים שזו גרסת תצוגה מקדימה ושהדאטהסט מאתגר ללמידה עצמאית במודלים של שבעה מיליארד פרמטרים, כך שלרוב נדרש לערבב אותו עם מאגרים אחרים כדי להגיע לתוצאות טובות.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מודל בעברית?

לא. הדאטהסט כולו באנגלית ואינו מכיל נתונים בעברית. אם תאמנו עליו מודל לעברית, הוא עשוי ללמוד את מבנה הדיאלוג אך לא ישפר את איכות השפה.

האם מותר להשתמש בו למוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 ומאפשר שימוש מסחרי. עם זאת, התשובות דורגו באמצעות gpt-4-turbo, ולכן מפתחים שבודקים תאימות לתנאי השימוש של ספקי מודלים צריכים לקחת זאת בחשבון.

כמה נתונים יש בפועל במאגר?

המאגר כולל בין אלף לעשרת אלפים רשומות בקובץ parquet בודד. זהו היקף קטן יחסית שנטען במהירות ואינו דורש נפח אחסון מיוחד.

איך נאספו התשובות וההעדפות?

התשובות נוצרו משלושה מודלי קוד פתוח לצד התשובה המקורית ממאגר Capybara. לאחר מכן, מודל gpt-4-turbo דירג את ארבע האפשרויות על סולם של 1 עד 5 לפי איכות כללית.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face דרך המזהה argilla/distilabel-capybara-dpo-7k-binarized. המידע שמור בקובץ parquet יחיד, פתוח לציבור וללא צורך באישור גישה מראש. לפני שמתחילים אימון בפורמט DPO, צריך לעבד את השדות chosen ו־rejected: לוקחים את כל היסטוריית השיחה כקלט הפרומפט, ומשאירים רק את ההודעה האחרונה של העוזר כטקסט שנבחר או נדחה. מומלץ לסנן את השדה rating_chosen כדי להשאיר דוגמאות איכותיות בלבד.

from datasets import load_dataset

ds = load_dataset("argilla/distilabel-capybara-dpo-7k-binarized")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי חופשי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו הרישיון. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗