GPT
G

gpt_roleplay_realm

קוד פתוח

IlyaGusevcc-by-4.02023-05-06

  • gpt-4
  • fictional
  • role-play
  • roleplay
  • gpt-3.5

מאגר שיחות סינתטיות ודמויות בדיוניות באנגלית וברוסית. הוא נועד לאמן מודלים לשמור על אישיות, הקשר וסגנון דיבור עקבי לאורך שיחה.

  • 541הורדות בחודש
  • 105לייקים

מה זה

המאגר מכיל דמויות בדיוניות שנבנו לחלוטין על ידי מודלים של שפה, ומחולק לשני חלקים שווים כמעט. החלק הרוסי כולל 219 דמויות, והחלק האנגלי כולל 216 דמויות. עבור כל דמות מוגדרים שם, תיאור רקע, משפט פתיחה, שיחה לדוגמה ותמונת פרופיל שנוצרה במודל קנדינסקי 2.1 ומכילה מטא נתונים מובנים של כרטיס הדמות.

הבנייה נעשתה בכמה שלבים רציפים. תחילה נוצרו הדמויות באמצעות GPT-4 על בסיס רשימות התחלתיות והנחיות קבועות. לאחר מכן הופקו עשרים נושאי שיחה ייחודיים לכל דמות, גם הם בעזרת GPT-4. על בסיס הנושאים האלה נבנו השיחות עצמן. השיחה הראשונה בכל נושא נוצרה באמצעות GPT-4, ויתר 19 השיחות לכל דמות הופקו באמצעות GPT-3.5.

מתאים ל

  • אימון משחקי תפקידים

    כוונון עדין של מודלי שפה לשמירה על דמות, סגנון ואישיות לאורך שיחה רציפה.

  • הערכת עקביות דמות

    בדיקת יכולת המודל לענות בהתאם לרקע עלילתי ספציפי בלי לשבור דמות.

  • יצירת סוכנים וירטואליים

    חילוץ כרטיסי דמות מובנים וטעינת פרטי רקע לסוכני שיחה מותאמים אישית.

איפה זה נופל

הנתונים כולם סינתטיים ומבוססים על GPT-4 ו־GPT-3.5 ממאי 2023, ללא שיחות אנושיות אמיתיות. אין כאן מילה אחת בעברית, כך שהוא רלוונטי רק למי שעובד באנגלית או ברוסית. בנוסף, רוב השיחות הופקו על ידי מודל פשוט יותר, GPT-3.5, מה שעלול לייצר תבניות שיחה צפויות שחוזרות על עצמן ומחייבות בדיקת איכות לפני אימון.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

לא. המאגר מציע אך ורק שני פיצולים נפרדים, אחד באנגלית ואחד ברוסית. אין בו תמיכה בשפות אחרות.

האם מותר להשתמש בו לאימון מודל מסחרי?

רישיון cc-by-4.0 מתיר שימוש מסחרי בכפוף למתן קרדיט. עם זאת, הנתונים הופקו באמצעות ממשקי OpenAI, ויש לבדוק את תנאי השימוש שלהם לגבי אימון מודלים מתחרים.

מאיפה הגיעו השיחות בדאטהסט?

כל השיחות סונתזו במיוחד לפרויקט. הנושאים והשיחה הראשונה בכל נושא נוצרו באמצעות GPT-4, ויתר השיחות נבנו בעזרת GPT-3.5.

כמה רשומות יש בסך הכל?

המאגר כולל 216 דמויות באנגלית ו־219 ברוסית. לכל דמות מוגדרים 20 נושאים ובסך הכל אלפי שיחות בודדות, בטווח שבין 1,000 ל־10,000 רשומות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה IlyaGusev/gpt_roleplay_realm ובחירת הפיצול הרצוי, en או ru. המאגר פתוח לציבור ואינו דורש אישור גישה מראש. הנתונים שמורים בקובצי parquet ומכילים עמודות טקסט של שדות הדמות, השיחות, וכן עמודת תמונה מסוג image שמחזיקה את כרטיס הדמות המלא בתוך נתוני הפינג.

from datasets import load_dataset

ds = load_dataset("IlyaGusev/gpt_roleplay_realm")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט הולם ליוצר המקורי. הוא אינו מחייב שיתוף של תוצרים באותו רישיון, כך שניתן לשלב את הנתונים באימון מודלים פנימיים או מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗