GPT
D

DPO-En-Zh-20k

קוד פתוח

llamafactoryapache-2.02024-04-19

  • dpo
  • orpo
  • rlhf
  • llama-factory

המאגר כולל עשרים אלף זוגות העדפה לאימון DPO באנגלית ובסינית, עם סינון איכות לפי ציונים קיימים. מי שרוצה ליישר מודל דו לשוני בלי לאסוף ולנקות דאטה בעצמו ימצא פה קיצור דרך מוכן לעבודה.

  • 448הורדות בחודש
  • 104לייקים

מה זה

הנתונים מורכבים משני קבצים עיקריים שמחלקים את החבילה לשתי שפות. החצי האנגלי מחזיק עשרת אלפים דוגמאות שנלקחו משלושה מקורות שונים של ארגילה: ארבעת אלפים מתוך קפיברה עם ציון ארבע ומעלה, שלושת אלפים מתוך אורקה של אינטל עם ציון שמונה ומעלה, ועוד שלושת אלפים מתוך אולטרה פידבק עם ציון ארבע ומעלה.

החצי השני מוקדש כולו לסינית ומכיל עשרת אלפים דוגמאות שנלקחו ישירות ממאגר זוגות DPO בסינית של המשתמש wenbopan. כל המבנה תוכנן כדי להזין ישירות את מסגרת האימון של LLaMA Factory תחת השמות המתאימים לכל שפה.

מתאים ל

  • יישור DPO באנגלית

    אימון שלבים סופיים של מודלי שפה על עשרת אלפים דוגמאות אנגליות שעברו סינון איכות לפי ציונים.

  • יישור מודל דו לשוני

    אימון העדפות מאוזן למודלים שצריכים לענות באנגלית ובסינית בלי לקבל הטיה לאחת השפות.

  • עבודה מובנית ב־LLaMA Factory

    הרצה מהירה של אימונים ישירות מתוך הכלי בלי צורך בהתאמת פורמטים מורכבת מראש.

איפה זה נופל

אין כאן מילה אחת בעברית, רק אנגלית וסינית. הדאטהסט הזה נשען לחלוטין על סינון שנעשה במאגרים המקוריים לפי ציונים מספריים, בלי עבודת בדיקה אנושית ידועה נוספת על החיבור ביניהם. מי שבונה מוצר שאינו מיועד ספציפית לעבודה דו לשונית בשתי השפות האלה יצטרך לסנן החוצה חצי מהדאטה או לחפש מקור אחר.

שאלות
נפוצות

האם מותר להשתמש במאגר הזה לפיתוח מוצר מסחרי?

כן, הרישיון המדווח במאגר הוא Apache 2.0. הרישיון מאפשר שימוש מסחרי מלא באימון מודלים ובמערכות פנימיות. הדרישה העיקרית היא הכללת קרדיט מתאים והודעת הרישיון המקורית בקוד שלכם.

האם המאגר מכיל דוגמאות בעברית?

לא, אין כאן עברית בכלל. המאגר מוגדר ומחולק לשתי שפות בלבד, אנגלית וסינית. אם מטרת האימון היא יישור מודל לדוברי עברית, הנתונים האלה לא יעזרו לכם.

מאיפה נאספו הנתונים האנגליים?

החלק באנגלית מורכב משלושה מאגרי העדפות מוכרים של חברת Argilla. היוצרים אספו עשרת אלפים דוגמאות מתוך קפיברה, אורקה של אינטל ואולטרה פידבק. הבחירה נעשתה לפי ספי ציונים מספריים שהוגדרו מראש לכל מאגר.

איך משלבים אותו בריצת אימון?

המאגר מגיע בתור שני קובצי JSON בשם dpo_en ו־dpo_zh. אפשר לטעון אותם ידנית בכל קוד פייתון או להגדיר את השמות שלהם ישירות בקובץ ההגדרות של LLaMA Factory. אין צורך בתהליך הרשמה או בקשת אישור מוקדמת כדי לגשת לקבצים.

איך טוענים

טוענים את הקבצים ישירות מהמאגר, שם הם שמורים בפורמט JSON פשוט ומחולקים ל־dpo_en ול־dpo_zh. אין צורך לבקש אישור גישה מיוחד כדי להוריד אותם. מי שעובד עם LLaMA Factory יכול להגדיר את השמות dpo_mix_en ו־dpo_mix_zh בהגדרות האימון שלו ולקבל טעינה מיידית בלי לבצע המרות מבנה נוספות.

from datasets import load_dataset

ds = load_dataset("llamafactory/DPO-En-Zh-20k")

הרישיון

הרישיון שדווח בעמוד הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, עריכה, הפצה ואימון של מודלים בלי לחייב אתכם לשחרר את הקוד שלכם באותו אופן. התנאי המרכזי כאן הוא שמירה על הודעות זכויות היוצרים והייחוס המקורי של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗