GPT
C

cinematika-v0.1

קוד פתוח

jondurbincc-by-nc-4.02023-11-28

המאגר כולל 211 תסריטי קולנוע שעובדו לפרוזה ומשחקי תפקידים מרובי דמויות. הוא מיועד למי שרוצה לאמן מודלים על דיאלוגים מורכבים וכרטיסי דמות מפורטים.

  • 227הורדות בחודש
  • 60לייקים

מה זה

הנתונים נשענים על 211 תסריטי סרטים שעברו פירוק ועיבוד לסגנון של רומן ומשחקי תפקידים. התהליך שילב ביטויים רגולריים ידניים שזיהו חלוקה לסצנות לפי תגיות מקובלות, יחד עם עיבוד שפה באמצעות מודל מותאם של mistral-7b.

התוכן מחולק לקבצי פארקט שונים. חלקם מכילים את הסצנות המעובדות, חלקם שומרים את התסריט השלם, ויש קבצים שמתמקדים בכרטיסי דמות עבור דמויות עם 15 שורות דיאלוג ומעלה. דמויות עם פחות שורות מוגדרות כדמויות משנה ברקע. בנוסף, יש סטים ייעודיים שמלמדים מודל איך לסכם סצנה או לבנות כרטיס דמות מטקסט קיים.

מתאים ל

  • אימון מודל למשחקי תפקידים

    לימוד מודלים לנהל דיאלוג עשיר בין מספר דמויות במקביל על בסיס סצנות תסריט מעובדות.

  • חילוץ כרטיסי דמות

    אימון מודל לקרוא דיאלוגים מורכבים ולבנות מהם פרופיל אופי והגדרות דמות באופן אוטומטי.

  • סיכום סצנות מורכבות

    שימוש בנתוני הסיכום כדי ללמד מודל לתמצת התרחשויות קולנועיות לתיאור תרחיש קצר.

איפה זה נופל

זהו אוסף של 211 סרטים בלבד, כך שכיסוי הסגנונות מוגבל מאוד. הנתונים מתבססים על תסריטים באנגלית, כך שמי שמחפש עברית או תרבויות אחרות לא ימצא פה מענה. בנוסף, התוכן עבר שכתוב באמצעות מודל שפה, מה שמכניס סגנון כתיבה מלאכותי והטיות של המודל המעבד לתוך הדיאלוגים המקוריים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון שנבחר הוא רישיון לא מסחרי. כל שימוש בנתונים או במודל שאומן עליהם מוגבל למחקר, ניסויים אישיים ופרויקטים פתוחים ללא כוונת רווח. אם המטרה היא להרוויח כסף, צריך לחפש מקור מידע אחר.

האם המאגר כולל תכנים בעברית?

לא, כל 211 התסריטים הם באנגלית בלבד. התהליך כולו, כולל תגיות התסריט והעיבוד של מודל השפה, מבוסס על השפה האנגלית. אין כאן התאמה לשפות אחרות או תרגומים מובנים.

איך התבצע עיבוד התסריטים בפועל?

היוצר השתמש בביטויים רגולריים ידניים כדי לזהות מעברי סצנות לפי מונחי תסריט מוכרים, ואיחד סצנות קצרות מדי. לאחר מכן, טקסט התסריט עבר עיבוד והרחבה באמצעות מודל מסוג מיסטרל שכוונן במיוחד למשימה הזו. התוצאה היא טקסט סיפורי שמלווה בכרטיסי דמויות ותקצירי סצנות.

איך טוענים

הנתונים יושבים בקובצי פארקט פתוחים להורדה ישירה דרך ספריית הדאטהסטס, בלי צורך באישור גישה מיוחד. המאגר כולל 16 קבצים, בהם טבלאות נפרדות לסצנות, תסריטים מלאים, כרטיסי דמות ואימוני עזר. בכל קובץ תמצאו שדות בסיסיים כמו מזהה סרט וכותרת, שמאפשרים לקשר בין הטבלאות השונות לפי הצורך.

from datasets import load_dataset

ds = load_dataset("jondurbin/cinematika-v0.1")

הרישיון

המאגר משוחרר ברישיון cc-by-nc-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי, וחובת מתן קרדיט מתאים ליוצר. אם אתם מתכננים לאמן מודל לצורך שירות בתשלום או כחלק ממוצר עסקי, הדאטהסט הזה חסום בפניכם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗