GPT
C

CharacterCodex

קוד פתוח

NousResearchapache-2.02024-06-05

  • language model

המאגר מרכז דמויות פופולריות מסרטים, ספרים וסדרות עם תיאורי אופי ותרחישים מקוריים. הוא נבנה במיוחד כדי לאמן או להזין מודלים במשחקי תפקידים ובכתיבה יוצרת.

  • 509הורדות בחודש
  • 245לייקים

מה זה

במאגר יש בין עשרת אלפים למאה אלף רשומות שמכסות דמויות ממגוון רחב של סוגי מדיה, החל מרומנים וסרטי קולנוע ועד סדרות טלוויזיה, אנימה וקומיקס רשת. כל רשומה כוללת את שם הדמות, יצירת המקור, סוג המדיה והז'אנר הספציפי שאליו היא משתייכת.

מעבר לפרטים היבשים, כל פריט מכיל שני שדות טקסטואליים מרכזיים. שדה אחד מפרט את התיאור של הדמות, התפקיד שלה בעלילה ותכונות האופי שלה, והשדה השני מציג תרחיש בדיוני ייחודי שנכתב עבורה ונועד להניע אינטראקציה עלילתית או שיחה.

לפי התיעוד של היוצרים, הדמויות נבחרו באופן יזום ומדוקדק ממקורות שונים, והתיאורים לצד התרחישים נוסחו במיוחד לצורך הפרויקט. אין בכרטיס פירוט לגבי שימוש בכלי סינון אוטומטיים או חלוקה מוגדרת מראש לתתי קבוצות של אימון ומבחן.

מתאים ל

  • אימון למשחקי תפקידים

    כוונון עדין של מודלי שפה כדי שיידעו להיכנס לדמות, לשמור על אופי עקבי ולהגיב בתוך סיטואציה בדיונית נתונה.

  • שליפת מידע לבוטים

    שימוש בתור בסיס ידע למערכות RAG שצריכות לשלוף רקע ותרחיש של דמות כדי להנחות שיחה בזמן אמת.

  • יצירת נתונים סינתטיים

    שימוש ברשומות כגרעין ליצירת דיאלוגים מורכבים ואינטראקציות עלילתיות בין דמויות עבור דאטהסטים אחרים.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, ואין בו שום ייצוג לתוכן בעברית או לדמויות מהתרבות המקומית. בנוסף, הכרטיס לא מפרט כיצד התיאורים והתרחישים נוצרו, כך שיש סיכוי סביר שמדובר בטקסט סינתטי שהופק על ידי מודלי שפה אחרים, מה שעלול להכניס הזיות או חזרתיות סגנונית.

הדמויות שנכללות במאגר מבוססות על מותגים וזכיונות מוכרים ומוגנים בזכויות יוצרים, כמו פוקימון. אם אתם בונים מוצר מסחרי, שימוש בשמות ובמאפיינים המדויקים האלה עלול לחשוף אתכם לתביעות קניין רוחני של בעלי הזכויות המקוריים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון הקוד הפתוח שבו המאגר מופץ מתיר שימוש מסחרי ללא תשלום תמלוגים. יחד עם זאת, הדמויות עצמן לקוחות מיצירות מוגנות כמו סרטים ואנימה. אם המוצר שלכם ישתמש בשמות ובמותגים המקוריים, אתם עלולים להפר זכויות יוצרים של בעלי היצירות.

האם יש במאגר תמיכה בעברית?

המאגר כולו כתוב באנגלית בלבד ואין בו נתונים בשפות אחרות. אם המטרה היא לאמן בוטים לשיחה בעברית, תצטרכו לתרגם את התיאורים והתרחישים או לפנות למאגר אחר. גם הדמויות והז'אנרים שנבחרו משקפים בעיקר תוכן בינלאומי ומערבי.

איך המידע נאסף ונכתב?

היוצרים מציינים שהדמויות נבחרו באופן מוקפד מתוך מגוון רחב של תחומי מדיה שונים. התיאורים והתרחישים חוברו במיוחד עבור הפרויקט הזה כדי ליצור הקשר עשיר. עם זאת, אין בתיעוד פירוט טכני האם הניסוח בוצע ידנית או בעזרת מודלי שפה.

מה הגודל של המאגר והאם קשה להוריד אותו?

המאגר כולל בין עשרת אלפים למאה אלף רשומות שנמצאות בתוך קובץ JSON יחיד. מדובר בטקסט בלבד ללא קובצי מדיה כמו תמונות או אודיו, כך שנפח ההורדה קטן מאוד. אפשר לטעון אותו תוך שניות ישירות לזיכרון בכל מחשב פיתוח סטנדרטי.

איך טוענים

הטעינה מתבצעת ישירות דרך ספריית datasets באמצעות פקודת load_dataset עם המזהה NousResearch/CharacterCodex. המאגר פתוח לציבור ואינו דורש אישור גישה מראש או מפתחות מיוחדים.

הקובץ המרכזי שבו מרוכזים הנתונים שמור בפורמט JSON בשם character_codex.json. בעבודה מעשית, השדות העיקריים שתרצו למשוך הם description לצורך בניית פרופיל הדמות בתוך פרומפט המערכת, ו־scenario שיכול לשמש כהקשר ראשוני לפתיחת שיחה או סצנה.

from datasets import load_dataset

ds = load_dataset("NousResearch/CharacterCodex")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי חופשי, שינוי של הנתונים והפצה מחדש. אין כאן דרישה של שיתוף תחת אותו רישיון עבור מודלים שתאמנו עליו, אך אתם מחויבים לכלול ייחוס למחברים המקוריים, עותק של הרישיון וציון אם נעשו שינויים במידע. חשוב לזכור שהרישיון של המאגר אינו מעניק זכויות יוצרים על הדמויות המסחריות עצמן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗