GPT
R

roleplay

קוד פתוח

hieunguyenminhcc-by-4.02023-12-08

  • roleplay
  • characters

שיחות מובנות באנגלית לאימון מודלים למשחקי תפקידים. המטרה כאן היא ללמד מודל לשמור על אישיות, דיאלקט ומטרות קבועות לאורך שיחה.

  • 181הורדות בחודש
  • 92לייקים

מה זה

המאגר מציע מעל 5,000 רשומות שמיועדות ליישומי צ'אט נרטיביים. כל רשומה כוללת את שם הדמות, תיאור מפורט של התכונות שלה, ומחרוזת טקסט אחת של שיחה שלמה שמורכבת מהודעת מערכת ועוד שלוש עד חמש החלפות מסרים בין משתמש לעוזר. הדמויות נעות בין דמויות בדיוניות מוכרות לבין פרסונות מקוריות לחלוטין שהומצאו עבור הפרויקט.

כל הנתונים נוצרו בצורה סינתטית באמצעות Gemini Pro של גוגל, שיצר את הדמויות ואת התסריטים שמדגימים סגנונות דיבור שונים, תגובות רגשיות ושיחות הומוריסטיות. הכרטיס לא מציין חלוקה מוגדרת מראש לחלקי אימון, בדיקה או ולידציה, וכל המידע מוגש יחד כחבילה אחת.

מתאים ל

  • אימון צ'אטבוטים למשחקי תפקידים

    כוונון עדין של מודלים קטנים כדי שילמדו לאמץ פרסונה, טון דיבור עקבי והנחיות מערכת.

  • בניית כלי כתיבה יוצרת

    פיתוח עוזרים שמתמחים ביצירת דיאלוגים מורכבים בין דמויות בדיוניות בעלות מטרות שונות.

  • מחקר על עקביות נרטיבית

    בדיקת היכולת של מודלי שפה לשמור על תכונות אופי ייחודיות לאורך מספר פניות בשיחה.

איפה זה נופל

הטקסט כולו נוצר ב־Gemini Pro, כלומר מקבלים הטיות ושפה מלאכותית שמוכרות ממודלים מסחריים בלי שיחות של אנשים אמיתיים. בנוסף, הכל באנגלית בלבד ואין שום עברית. לא הייתי דוחף את זה ישר למוצר לפני שמוודאים שהדמויות המוכרות שנוצרו שם לא מפרות זכויות יוצרים של גורמי צד שלישי, במיוחד אם השם של הדמות מוגן.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא. כל הנתונים נכתבו באנגלית בלבד. אם המטרה היא לאמן צ'אטבוט בעברית, תצטרכו לתרגם את הרשומות או לייצר נתונים ייעודיים.

האם מותר להשתמש בזה לאימון מודל מסחרי?

רישיון CC-BY 4.0 מתיר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, הנתונים הופקו ב־Gemini Pro וכוללים דמויות מוכרות, ולכן מומלץ לוודא שאין התנגשות עם תנאי השימוש של גוגל או זכויות יוצרים.

מאיפה הגיעו הנתונים שבמאגר?

הנתונים לא נאספו משיחות אנושיות באינטרנט. הם נכתבו כולם בצורה סינתטית על ידי המודל Gemini Pro לפי הנחיות שונות שהוגדרו מראש.

כמה מקום הדאטהסט הזה תופס?

מדובר במאגר קטן מאוד של קצת מעל 5,000 שורות. הוא מגיע בקובץ parquet יחיד ובקובץ json, כך שההורדה לוקחת שניות בודדות ולא דורשת משאבי אחסון מיוחדים.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face דרך המזהה hieunguyenminh/roleplay, בלי צורך בבקשת גישה מיוחדת. הנתונים זמינים בקובץ parquet יחיד בתיקיית data וגם בקובץ data.json, כך שמדובר בנפח זעיר של אלפי רשומות בודדות שיורד תוך שניות. בפנים מחכים שלושה שדות: name, description, והשדה text, שבו נמצאת כל השיחה בפורמט שמשלב תגיות מערכת, משתמש ועוזר.

from datasets import load_dataset

ds = load_dataset("hieunguyenminh/roleplay")

הרישיון

הרישיון המדווח הוא CC-BY 4.0, שמתיר שימוש מסחרי, שינוי והפצה של הדאטהסט ושל מודלים שאומנו עליו. התנאי היחיד הוא מתן קרדיט מתאים ליוצר המקורי. עם זאת, מכיוון שהנתונים נוצרו ב־Gemini Pro ומכילים דמויות בדיוניות מוכרות, חובת הזהירות לגבי תנאי השימוש של גוגל וזכויות יוצרים על הדמויות עצמן חלה על המשתמש.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗