GPT
C

ChatHaruhi-54K-Role-Playing-Dialogue

קוד פתוח

silk-roadcc-by-4.02023-08-22

שיחות מובנות לחיקוי אישיות, טון ועלילות של דמויות בדיוניות. המאגר מציע אלפי דוגמאות דו לשוניות שמיועדות לאימון מודלים למשחקי תפקידים.

  • 182הורדות בחודש
  • 69לייקים

מה זה

המאגר כולל עשרות אלפי רשומות שמטרתן לחקות דמויות מוכרות, החל מדמויות אנימה כמו הארוהי סוזומיה ועד לסדרות טלוויזיה כמו המפץ הגדול ומשחקים כמו גנשין אימפקט. הנתונים נאספו מתסריטים של סדרות טלוויזיה, זיהוי קולי מאודיו, תסריטי משחק והנחיות מערכת שנאספו על ידי צוות מפתחים מקהילות קוד פתוח דוגמת דאטה וויל. חלק מהנתונים עבר הרחבה ועיבוד לצורך יצירת שיחות אימון.

התוכן מאורגן בקובץ מרכזי בפורמט שורות ג'ייסון בשם Haruhi_54K_v1.jsonl. הרשומות מייצגות חילופי דברים ואינטראקציות שמטרתן לשמר את אופי הדמות, אופן הדיבור שלה וקווי העלילה שמגדירים אותה, במקום תגובות גנריות של עוזר וירטואלי סטנדרטי. למי שזקוק לחלוקה מפורשת יותר של קלט מול פלט, היוצרים מפנים למאגר המשך נפרד שמבוסס על הנתונים האלה.

מתאים ל

  • אימון צ'אטבוטים של דמויות

    פיין טיונינג למודלי שפה כדי לחקות סגנון דיבור ואישיות בדיונית מוגדרת.

  • מחקר על שימור אישיות

    בדיקת היכולת של מודלים להישאר בתוך הדמות לאורך שיחה ממושכת.

  • יצירת דיאלוגים למשחקים

    הפקת טקסטים אוטומטיים לדמויות ללא שחקן על בסיס דפוסי שיחה קיימים.

איפה זה נופל

המאגר מכיל רק אנגלית וסינית, כך שאין כאן שום תוכן בעברית. הנתונים מתבססים על תסריטים של דמויות ספציפיות כמו הארוהי סוזומיה, דמויות מתוך המפץ הגדול וגנשין אימפקט, ולכן הם מוטים מאוד לסגנון הדיבור של הדמויות האלה ולא יתאימו לשיחות מקצועיות. בנוסף, חלקי המידע נאספו בעזרת כלי זיהוי דיבור אוטומטיים, מה שעלול לגרור שגיאות תמלול בטקסט עצמו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

עדיף שלא. בדף מופיע רישיון המאפשר שימוש מסחרי עם קרדיט, אך בגוף הטקסט מופיע תג שאוסר שימוש מסחרי לחלוטין. בגלל חוסר העקביות הזה, כל שימוש שאינו מחקרי חושף אתכם לסיכון משפטי.

האם יש במאגר שיחות בעברית?

לא, אין בו עברית כלל. המאגר מוגדר ומכיל טקסטים בשפות אנגלית וסינית בלבד. אם המטרה היא מודל תפקידים מקומי, תצטרכו לתרגם את החומר או להשתמש במקור אחר.

מאיפה הגיעו הנתונים שנמצאים בפנים?

הנתונים נאספו ממספר מקורות בדיוניים ספציפיים על ידי צוות הפרויקט. הם כוללים תסריטים של הארוהי סוזומיה, נתונים מהסדרה המפץ הגדול, וטקסטים ודיאלוגים מתוך המשחק גנשין אימפקט. חלק מהאיסוף נעשה באמצעות כלי זיהוי דיבור אוטומטיים מתכני וידאו ואודיו.

איך טוענים

טוענים את הקובץ ישירות דרך ספריית הדאטהסטס הרגילה או מורידים ישירות את הקובץ Haruhi_54K_v1.jsonl מתוך המאגר. הגישה פתוחה לחלוטין ללא צורך באישור מוקדם או בהרשמה מיוחדת. לפני שמתחילים לאמן, צריך לקרוא את מבנה השדות הפנימי בכל שורת ג'ייסון, שכן הנתונים שמורים כטקסט שיחה ולא בהכרח בחלוקה פשוטה של הנחיה ותשובה.

from datasets import load_dataset

ds = load_dataset("silk-road/ChatHaruhi-54K-Role-Playing-Dialogue")

הרישיון

יש סתירה ישירה שחייבים להכיר לפני שנוגעים בחומר. המטאדאטה של הדף מציגה רישיון פתוח מסוג סי סי בי וואי 4.0 שמתיר שימוש מסחרי תחת מתן קרדיט בלבד. לעומת זאת, התג המוטמע בטקסט המאגר קובע רישיון סי סי בי וואי אן סי 4.0, שאוסר במפורש כל שימוש מסחרי. במצב כזה מודל שמאומן על הנתונים מסתכן בהפרת זכויות, ולכן בטוח להשתמש בו למחקר בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗