GPT
V

visual-novels

קוד פתוח

alpindaleapache-2.02023-06-14

תסריטים מעובדים של רומנים חזותיים בהיקף של כשישים מיליון טוקנים. המאגר מיועד למי שרוצה לאמן מודלים על דיאלוגים מרובי משתתפים שמשלבים פעולות ותיאורי סצנה.

  • 257הורדות בחודש
  • 69לייקים

מה זה

המאגר כולל תסריטים שנאספו ממשחקי visual novels שונים ועובדו לטקסט קריא. הפורמט העיקרי מציג שורות דיאלוג עם שם הדובר, נקודתיים והטקסט במירכאות. תיאורי פעולה ונרטיב מופיעים לרוב בין כוכביות, אם כי היוצרים מציינים שלא כל התסריטים שומרים על המבנה הזה בעקביות.

התוכן מגיע בכמה תצורות בקבצי הארכיון. ישנו קובץ טקסט רגיל אחד שבו כל התסריטים המעובדים משורשרים ברצף עם כותרת מפרידה לכל משחק, וקובץ דחוס שמכיל את אותם תסריטים מעובדים כקבצים נפרדים. בנוסף יש תיקייה עם קבצי json שמכילים מזהי דמויות מתוך מסד הנתונים VNDB עבור היצירות המעובדות, וארכיון נפרד שמחזיק את התסריטים הגולמיים, כולל חומרים שעדיין לא עברו עיבוד.

מתאים ל

  • אימון מודלי שיחה

    לימוד מודלים לנהל דיאלוגים מורכבים עם שמירה על שמות דוברים והקשר עלילתי.

  • כתיבת נרטיב משולב פעולה

    יצירת טקסט המשלב בין שורות מדוברות לבין תיאור פעולות גופניות ותנועה במרחב.

  • ניתוח דמויות

    מיפוי דפוסי דיבור והתנהגות לפי מזהי הדמויות שנלקחו ממאגר VNDB.

איפה זה נופל

הטקסט כולו באנגלית ואין בו שום תוכן בעברית. הבעיה העיקרית כאן היא זכויות יוצרים, שכן מדובר בתסריטים של משחקים מסחריים שנאספו ללא אישור מבעלי הזכויות. מעבר לכך, העיבוד אינו אחיד לחלוטין וחלק מהפעולות או שמות הדוברים מופיעים בצורות שונות בין משחקים שונים, מה שמחייב בדיקה וסינון ידני לפני אימון.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

עדיף שלא לגעת בזה לפרויקטים מסחריים. למרות הסימון של אפאצ'י 2.0, הטקסטים שייכים לחברות מסחריות שכתבו את המשחקים. היוצרים אף מצהירים שהטקסט שייך לבעלי הזכויות ומיועד למחקר בלבד.

האם יש במאגר תמיכה בעברית?

אין במאגר עברית בכלל. כל התסריטים המעובדים והגולמיים מופיעים באנגלית בלבד. אם המטרה היא מודל עברי, המאגר הזה לא רלוונטי עבורכם.

איך התוכן נאסף ועובד?

צוות מעבדי הנתונים של פרויקט PygmalionAI אסף תסריטים מקוריים של משחקי visual novels. הם פירקו את הטקסטים הגולמיים והמירו אותם למבנה אחיד של שורות דיאלוג ותיאורים, תוך הצלבת הדמויות מול אתר VNDB.

באיזה פורמט מקבלים את המידע?

הנתונים לא מגיעים כדאטהסט רגיל של האגינג פייס אלא כקבצי טקסט וארכיונים מכווצים מסוג tar.zst. ישנו קובץ יחיד שמרכז הכל ברצף, לצד ארכיונים עם קובץ נפרד לכל תסריט ותיקיית ג'ייסון עם מזהים.

איך טוענים

הנתונים לא מגיעים בטבלה סטנדרטית אלא כארכיונים דחוסים בפורמט zst וקובצי טקסט וג'ייסון. אין צורך בבקשת גישה מיוחדת להורדה. כדי להשתמש בחומר תצטרכו לחלץ את הארכיונים בעצמכם, לנקות שורות שלא תואמות בדיוק לתבנית הרצויה, ולהחליט אם אתם עובדים עם הקובץ המאוחד או עם הקבצים הבודדים.

from datasets import load_dataset

ds = load_dataset("alpindale/visual-novels")

הרישיון

המאגר מסומן ברישיון apache-2.0, אך היוצרים עצמם מודים בעמוד שהחומר מוגן בזכויות יוצרים של המפתחים המקוריים ונועד למחקר. שימוש מסחרי במודל שאומן עליו יוצר סיכון משפטי ברור, והרישיון הפתוח תקף לכל היותר לקוד העיבוד ולא לטקסטים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗