GPT
R

roleplay-zh-sharegpt-gpt4-data

קוד פתוח

shibing624apache-2.02024-06-26

שיחות רב סבביות למשחקי תפקידים בסינית שנוצרו על ידי מודלים של OpenAI. המטרה היא לאמן מודלים לשמור על עקביות אופי וסגנון דיבור מוגדר.

  • 486הורדות בחודש
  • 73לייקים

מה זה

הנתונים מחולקים לארבעה קבצי jsonl נפרדים. שלושה מהם מבוססים על מאגר evol-character-entire ומכילים שיחות שנוצרו עם GPT-4 ו־GPT-3.5, כולל קובץ ייעודי לדמויות גבריות. הקובץ הרביעי מבוסס על מאגר roleplay_multiturn_chat_1k_zh וכולל אלף שיחות רב סבביות.

כל הרשומות הומרו למבנה של ShareGPT, ובנוסף נוסף לכל רשומה שדה system_prompt שמגדיר את זהות הדמות, רקע, סגנון שפה והתנהגות. תהליך היצירה התבסס על סט מאפיינים ידני ראשוני, הרחבה של ההגדרות בעזרת הנחיות מיוחדות, לולאת משוב משולבת של בני אדם ו־GPT-4, ולבסוף הפקת השיחות בשיטת self-instruction.

מתאים ל

  • אימון מודל תפקידים בסינית

    כוונון עדין של מודלי שפה לניהול שיחה לפי הנחיות מערכת מוגדרות.

  • אימון SFT עם MedicalGPT

    הרצת אימון מהירה בזכות התאמת מבנה הרשומות לפרויקט הקוד של המפרסם.

  • בחינת שיטות הרחבת הנחיות

    ניתוח האופן שבו הנחיות דמות מתפתחות באמצעות משוב משולב אדם ומכונה.

איפה זה נופל

כל הנתונים הם בסינית בלבד, כך שלפיתוח בעברית אין פה שום ערך ישיר. מעבר לכך, היוצר מצהיר בפירוש שהנתונים הופקו במלואם דרך ה־API של OpenAI ללא בדיקת עובדות או סינון בטיחות קפדני. בשיחות משחקי תפקידים מסוג זה מודלים נוטים להמציא עובדות או לחרוג מהתנהגות רצויה, כך שחובה להריץ סינון תוכן עצמאי לפני שמשלבים את המידע באימון מודל שמיועד למשתמשי קצה.

שאלות
נפוצות

האם המאגר כולל נתונים בעברית?

לא, כל השיחות והגדרות הדמויות במאגר כתובות בסינית בלבד. הוא אינו כולל שפות נוספות. למי שמפתח מודל לעברית המאגר הזה לא יספק דוגמאות מוכנות.

האם מותר להשתמש בנתונים האלה למוצר מסחרי?

רישיון המאגר המדווח הוא apache-2.0, שמאפשר שימוש מסחרי בקוד ובנתונים. עם זאת, החומר נוצר באמצעות OpenAI, ולכן יש לוודא שהשימוש שלכם אינו מפר את תנאי השירות שלהם. המפרסם מציין גם שחובת בדיקת זכויות היוצרים של דמויות חלה על המשתמש.

איך נאספו השיחות שבמאגר?

הנתונים לא נלקחו משיחות אמיתיות של משתמשים אלא סונתזו לחלוטין דרך ממשקי GPT-3.5 ו־GPT-4. התהליך כלל כתיבת מאפיינים בסיסיים, פיתוח אופי הדמות בעזרת פרומפטים ייעודיים, סינון בלולאת משוב, ויצירת השיחות בגישת self-instruction.

מה הפורמט של הקבצים במאגר?

כל ארבעת קובצי המידע נשמרים בפורמט jsonl ומובנים לפי התקן של ShareGPT. בנוסף למבנה הרגיל של תורות שיחה, נוסף שדה ייעודי בשם system_prompt שמרכז את כל פרטי הרקע של הדמות.

איך טוענים

טוענים את הקבצים ישירות בפורמט jsonl בלי צורך באישור גישה מיוחד. המאגר כולל מחברת Jupyter בשם convert_evol_data_to_sharegpt שמציגה איך ההמרה בוצעה בפועל. השדות החשובים לטעינה הם תוכן השיחה ושדה ה־system_prompt שמחזיק את הגדרת הדמות. מי שמשתמש בספריית MedicalGPT של אותו יוצר יכול להריץ איתה אימון SFT באופן ישיר.

from datasets import load_dataset

ds = load_dataset("shibing624/roleplay-zh-sharegpt-gpt4-data")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0 שמתיר שימוש מסחרי, שינוי והפצה של הקוד והנתונים, בתנאי ששומרים על הודעת הזכויות והרישיון המקורי. יחד עם זאת, הכרטיס מדגיש שהטקסטים נוצרו ב־API של OpenAI, מה שמחייב בדיקה של תנאי השימוש מולם לגבי אימון מודלים מתחרים, לצד זהירות בנוגע לזכויות יוצרים של דמויות ספציפיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗