GPT
D

DPO-zh-en-emoji

קוד פתוח

shareAIapache-2.02024-05-04

מאגר שיחות דו לשוני באנגלית ובסינית שמשלב אימוג'י טקסטואליים בתשובות. הוא נבנה כדי לאמן מודלים על סגנון דיבור קליל ויכולות חשיבה דרך שאלות היגיון ודיונים ברשת.

  • 391הורדות בחודש
  • 57לייקים

מה זה

הנתונים מורכבים משאלות שנאספו מרשת Zhihu, מקהילת Ruozhiba הידועה בחידות היגיון מתחכמות, וממשימות חשיבה לוגית. עבור כל שאילתה כזו, היוצרים דגמו תשובות באמצעות המודל llama3 70b instruct, כשלכל שאלה נוצרה תשובה בסינית ותשובה מקבילה באנגלית שכוללות אימוג'י.

המבנה הפנימי מחולק לקבצי jsonl לפי מקורות השאלות, בהם קובץ להיגיון בשם 0_dpo_loji.jsonl, שני חלקים של שאלות מתוך Zhihu, וקובץ ייעודי לשאלות מתוך Ruozhiba. בנוסף קיים קובץ מאוחד המותאם לכלי Firefly. סך הכל יש במאגר שבעה קבצים, והוא מיועד לכוונון העדפות כמו DPO או ORPO וכן לאימון הוראות רגיל.

מתאים ל

  • אימון DPO לסגנון קליל

    כוונון העדפות של מודל כדי שישלב אימוג'י טקסטואלי וסגנון שיחה לא פורמלי באנגלית ובסינית.

  • אימון שאלות ותשובות מורכבות

    אימון הוראות בסיסי לשיפור היכולת להתמודד עם שאלות היגיון וחידות שמקורן ברשת.

  • יישור שפה ומעבר שפות

    אימון המודל להתאים את עצמו לשפה המבוקשת באמצעות שאילתות זהות שמקבלות מענה באנגלית ובסינית.

איפה זה נופל

התשובות כולן הן פלט סינתטי שנוצר בידי llama3 70b instruct, כך שכל טעות, הזיה או הטיה של המודל הזה נכנסו פנימה. מעבר לכך, המאגר מוגבל אך ורק לאנגלית ולסינית. אין בו עברית בכלל. השאלות נשענות בכבדות על הומור, סלנג ותרבות דיון של פלטפורמות סיניות ספציפיות, מה שלא בהכרח יתורגם נכון במערכות המיועדות לקהל מערבי או מקומי. אם אתם בונים מוצר שדורש תשובות רשמיות או מדויקות עובדתית, הסגנון הקליל והאימוג'י עלולים לעשות בדיוק את ההפך.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא apache-2.0, שמאפשר שימוש מסחרי חופשי. החובה העיקרית היא מתן קרדיט וצירוף עותק של הרישיון המקורי.

האם הדאטהסט כולל תמיכה בעברית?

לא, המאגר כולל רק נתונים בסינית ובאנגלית. אם המטרה היא אימון בעברית, הנתונים האלה לא יעזרו לכם באופן ישיר.

איך נוצרו התשובות שמופיעות בקבצים?

היוצרים אספו שאילתות ממקורות שונים כמו Zhihu וחידות היגיון, והריצו אותן דרך המודל llama3 70b instruct. המודל ייצר לכל שאלה תשובה באנגלית ותשובה בסינית הכוללות אימוג'י.

איך טוענים

הקבצים יושבים בפורמט jsonl פתוח לגמרי, בלי צורך באישור גישה או בהרשמה מיוחדת מול Hugging Face. כדי לטעון אותו אפשר להשתמש ישירות בספריית datasets או לקרוא את קובצי ה jsonl מקומית, כולל הקובץ המאוחד merged_dpo_zh_emoji_for_firefly.jsonl. צריך לשים לב שהרשומות מפוצלות לפי מקורות השאילתות, כך שאם אתם מכוונים רק לסגנון מסוים כמו שאלות היגיון, אפשר לטעון ישירות את הקובץ המתאים במקום את כל החבילה.

from datasets import load_dataset

ds = load_dataset("shareAI/DPO-zh-en-emoji")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי של המידע ושילוב שלו במערכות פנימיות, כל עוד אתם שומרים על הודעת הרישיון המקורית ונותנים ייחוס מתאים ליוצרים. הרישיון אינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗