GPT
M

Muice-Dataset

קוד פתוח

Moemucc-by-nc-4.02023-11-18

  • ACGN

מאגר שיחות בסינית שנכתב ידנית כדי לאמן מודלים לגלם דמות אנימה מוגדרת. הוא נועד למי שרוצה לבנות צ'אטבוט עם סגנון דיבור מובחן ולא עוד עוזר וירטואלי סטנדרטי.

  • 234הורדות בחודש
  • 59לייקים

מה זה

המאגר מכיל 3,541 דוגמאות שיחה שנועדו לבניית אישיות של דמות בדיונית בשם מואיס. כל הנתונים נכתבו באופן ידני במסגרת משחק תפקידים, כדי לפצות על המחסור בדיאלוגים טבעיים ויומיומיים שמאפיין תסריטי אנימה רגילים. הדיאלוגים נוגעים בשיחות יום חולין, רגשות, שאלות טכניות וחיזוק המודעות העצמית של הדמות.

חלק האימון כולל את קובץ הבסיס לצד תיקייה של קבצים מותאמים שעברו שכתוב ממקורות חיצוניים מוכרים. בין היתר נלקחו ועובדו נתונים מפרויקט הצ'אט של ChatGLM עבור הגדרת הזהות, וכן נתונים ממאגר COIG CQIA המבוססים על ruozhiba ועל wikihow. מערך הבדיקה מופרד בקובץ משלו כדי לאפשר בחינה מסודרת של התוצאות.

מתאים ל

  • אימון צ'אטבוט אנימה

    לימוד סגנון דיבור ייחודי ואישיות מובחנת לשיחות יומיומיות בסינית.

  • מחקר משחקי תפקידים

    בחינת היכולת של מודלים לשמור על עקביות של דמות לאורך שיחה.

  • הערכת סגנון וטון

    שימוש במערך הבדיקה כדי למדוד אימוץ סלנג ודפוסי תגובה לא שגרתיים.

איפה זה נופל

המאגר כתוב כולו בסינית ולא יתאים למי שמחפש עברית או אנגלית. היוצרים מציינים במפורש שהם פישטו תשובות מקצועיות כדי לשמור על שפה יומיומית, ולכן מודל שיאומן עליו עלול לספק תשובות שגויות בעובדות, ולרדת בביצועים בקוד ובהיגיון. בנוסף, מתוך ניסיון לחקות דיבור של דמויות אנימה, הטקסט כולל גידופים והטיות נגד המשתמש, מה שהופך אותו ללא מתאים למערכות שירות או למוצרים הדורשים סינון בטיחות קפדני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא לא מסחרי ודורש פנייה ליוצר אם רוצים חריגה. כל מודל שמבוסס עליו מוגבל לשימוש מחקרי או אישי בלבד.

האם יש במאגר תמיכה בעברית?

לא, כל הנתונים כתובים בסינית בלבד. אין במאגר טקסטים בעברית והוא לא מתאים לפרויקטים מקומיים בשפה זו.

מה הגודל של המאגר והאם צריך שרת חזק כדי להוריד אותו?

המאגר קטן מאוד וכולל 3,541 רשומות בלבד בפורמט טקסט. ההורדה שוקלת מגה בייטים בודדים ואינה דורשת משאבים מיוחדים.

מאיפה הגיעו הנתונים שבפנים?

רוב השיחות נכתבו ידנית במסגרת משחק תפקידים על ידי יוצר הפרויקט. חלק קטן שוכתב ממאגרים ציבוריים כמו COIG CQIA כדי לתת מענה לשאלות ידע וזהות.

איך טוענים

הנתונים מסודרים בפורמט Sharegpt בתוך קובצי jsonl סטנדרטיים, כך שאין צורך בהמרות מורכבות כדי להזין אותם לספריות אימון מודרניות. הגישה למאגר פתוחה לגמרי ואינה דורשת אישור מיוחד או הרשמה מוקדמת. כל הקבצים מוגדרים תחת חלוקה ברורה של אימון ומבחן בהגדרות המאגר. מבחינת נפח מדובר באלפים בודדים של רשומות, מה שאומר שההורדה והטעינה מתבצעות תוך שניות בודדות ללא דרישות זיכרון חריגות. לפני שמתחילים להריץ כדאי לבדוק את מבנה ההודעות בקובצי המקור כדי לוודא התאמה מדויקת לטמפלייט השיחה של המודל שלכם.

from datasets import load_dataset

ds = load_dataset("Moemu/Muice-Dataset")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. המשמעות היא שאסור להשתמש בנתונים למטרות מסחריות, כולל אימון מודל שנמכר כשירות או מוטמע במוצר מסחרי, ללא אישור מפורש מבעל הזכויות. מותר לעבד ולשנות את החומרים לצורכי מחקר ושימוש פרטי בלבד, תחת מתן קרדיט מלא ליוצר.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗