GPT
T

TheatreLM-v2.1-Characters

קוד פתוח

G-reencc-by-2.02024-08-01

חמשת אלפים כרטיסי דמות בדיוניים באנגלית הכוללים עולם, עלילה וספר רקע. מתאים למי שרוצה לאמן מודלים למשחקי תפקידים או לכתיבה יוצרת.

  • 59הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל 5,000 רשומות סינתטיות שנבנו לצורך משחקי תפקידים ויצירת נתונים. כל רשומה כוללת את שם הדמות, פרופיל מפורט, תקציר דמות, כרטיס דמות בפורמט משתנה, תיאור עולם מלא ותקציר שלו, קווי עלילה, פסקת פתיחה לסיפור וספר רקע עם ישויות מופרדות בלוכסנים.

התוכן נוצר כולו באמצעות מודל השפה llama3-70b שהופעל דרך שירות groq. תהליך היצירה התבסס על שילובים של קטגוריות תוכן, מיקומים ותכונות אופי, שעובדו בשרשרת פרומפטים כדי לייצר את העולם, הדמויות והקשרים ביניהם. אין במאגר חלוקה מוגדרת מראש לחלקי אימון ומבחן.

מתאים ל

  • אימון משחקי תפקידים

    כוונון עדין של מודלים לאימוץ דמות, שפה ורקע עלילתי עקביים.

  • יצירת דאטהסטים סינתטיים

    בסיס ליצירת דיאלוגים מורכבים בין דמויות על סמך עולמות מוגדרים מראש.

  • הזנת עולמות לכלים יצירתיים

    שליפת נתוני עולם ודמות כהקשר למערכות כתיבה אוטומטיות.

איפה זה נופל

כל הטקסט נוצר במודל שפה יחיד, ויש בו עקבות סינתטיים כמו פתיחים בנוסח Here is your setting. שמות הדמויות חוזרים על עצמם לעיתים קרובות. הדאטהסט כולו באנגלית, כך שהוא לא יעזור לאימון ישיר בעברית בלי תרגום. היוצר מציין במפורש מגבלות תקציב שהובילו לשימוש במודל שאינו בחזית הטכנולוגיה, ולכן יש לבצע סינון של קלישאות לשוניות וביטויים חוזרים לפני שדוחפים את המידע למודל פעיל.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט במוצר מסחרי?

כן, רישיון cc-by-2.0 מתיר שימוש מסחרי מלא. התנאי היחיד הוא ציון קרדיט ליוצר המקורי כפי שהרישיון דורש. מודלים שאומנו עליו יכולים לשמש גם במוצרים סגורים.

האם החומר מכיל עברית?

לא. כל 5,000 הרשומות נוצרו באנגלית בלבד. אם המטרה היא עבודה בעברית, תצטרכו לתרגם את השדות באופן עצמאי לפני האימון.

איך המידע נאסף?

הנתונים לא נאספו מאתרים או מספרים, אלא נוצרו מאפס באופן סינתטי. היוצר הפעיל את המודל llama3-70b עם שרשרת פרומפטים קבועה שבנתה עולם, דמות ועלילה סביב נושאים שנבחרו מראש.

במה הוא שונה מדאטהסטים אחרים של כרטיסי דמות?

הוא מחבר כל דמות ישירות לעולם מפורט, לספר רקע ייעודי ולפסקת פתיחה של סיפור. בנוסף, כרטיסי הדמות נוסחו בכוונה בכמה פורמטים ובאיכויות משתנות כדי לאמן מודלים להתמודד עם קלטים פחות מושלמים.

איך טוענים

המאגר מכיל קובץ נתונים ראשי בשם worlds.json וטוענים אותו ישירות לתוך קוד פייתון או ספריית הדאטהסטים. הגישה פתוחה ואין צורך באישור מיוחד. בעבודה עם הרשומות כדאי לשים לב לשדות setting, character, lorebook וכן לשדה character_card, שנוסח במכוון במגוון רמות איכות ופורמטים שונים כדי להרגיל מודלים לפלטים מגוונים.

from datasets import load_dataset

ds = load_dataset("G-reen/TheatreLM-v2.1-Characters")

הרישיון

הרישיון הוא cc-by-2.0. מותר להשתמש בנתונים למטרות מסחריות, לשנות אותם ולשלב אותם במערכות אחרות. התנאי המרכזי הוא מתן קרדיט ברור ליוצר המקורי לפי דרישות הרישיון. שימוש בנתונים לאימון מודל אינו מחייב הפצה תחת אותו הרישיון, כל עוד הקרדיט נשמר כנדרש.

הרישיון המלא ב־Hugging Face ↗