GPT
B

b-corpus

קוד פתוח

Limourcc-by-nc-sa-4.02024-01-23

  • not-for-all-audiences

מאגר שיחות עצום בסינית שנאסף מרומנים חזותיים למבוגרים ומתאים לאימון דיאלוגים ומשחקי תפקידים. הוא כולל כמעט שמונה מיליון שורות של שיח עלילתי ואישי.

  • 438הורדות בחודש
  • 81לייקים

מה זה

המאגר מכיל כ־7.86 מיליון שורות דיאלוג בסינית, שמצטברות לכ־183 מיליון טוקנים. הטקסטים נלקחו מתוך רומנים חזותיים, רבים מהם מוגדרים כתוכן למבוגרים (R18), לצד תסריטים ממשחקים מוכרים של חברות כמו Key, Nitro+, 5pb ו־FrontWing. בנוסף לעלילות המשחקים, יש במאגר חלוקה לתיקיות ספציפיות כמו תצוגה מקדימה וקבצי משחקי תפקידים סביב דמויות מסוימות, למשל דמויות מעולם הארי פוטר.

מבחינת מבנה, החומר מחולק ל־1,360 קבצים הכוללים טקסטים גולמיים לצד קבצים דחוסים וטבלאות נתונים. המפרסם מציין מקורות וכלים ששימשו לחילוץ הטקסטים, כולל פרויקטים כמו SakuraLLM ו־LunaHook. הכרטיס לא מפרט תהליכי סינון, ניקוי רעשים או בדיקות איכות שבוצעו על הדיאלוגים, ולכן הטקסט מופיע כפי שנשאב מתוך התסריטים המקוריים.

מתאים ל

  • אימון צ'אטבוטים למשחקי תפקידים

    אימון מודלים בסינית לניהול שיחות עלילתיות המבוססות על דמויות מרומנים גרפיים ומשחקים.

  • מחקר על שפה דרמטית בסינית

    ניתוח בלשני של סגנונות כתיבה, ביטויי רגש ושיח בדיוני בדיאלוגים מתורגמים ומקוריים.

  • הערכת מודלי שפה בטקסט שיחתי

    בדיקת ביצועים של מודלים ביצירת המשכי שיחה ארוכים בהקשרים נרטיביים מורכבים.

איפה זה נופל

הנתונים כולם בסינית ומקורם ברומנים חזותיים למבוגרים, כך שהם כוללים תכנים בוטים, קיצוניים, פוגעניים ולא הולמים לפי עדות המפרסם עצמו. אין כאן שום ייצוג לעברית או לשפות אחרות. מעבר לזה, המאגר מורכב כולו מדיאלוגים פיקטיביים של דמויות משחק, כך שהוא נוטה לשפה מוגזמת, לא טבעית לעולם האמיתי, וחסר כל מידע עובדתי מהימן או שימושי לפיתוח יישומים כלליים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

לא. הרישיון המוגדר הוא cc-by-nc-sa-4.0, והמפרסם אף הדגיש במפורש שחל איסור מוחלט על שימוש מסחרי בנתונים ובכל יצירה נגזרת מהם. אם אתם מפתחים מוצר למטרות רווח, לא תוכלו להשתמש בו.

האם המאגר כולל טקסטים בעברית או באנגלית?

המאגר מוגדר לשפה הסינית בלבד. הטקסטים עצמם הם תרגומים או מקורות בסינית מתוך משחקים יפניים בעיקר, ואין בו נתונים בעברית כלל. שמות היצירות בלבד מופיעים לעיתים באנגלית בטבלאות התיעוד.

מאיפה נאספו הנתונים?

הטקסטים נשלפו מתוך תסריטים של רומנים חזותיים באמצעות כלי חילוץ שונים ופרויקטים קהילתיים כמו SakuraLLM. המאגר מאגד מאות כותרים מוכרים, כאשר רוב החומר מגיע ישירות מקובצי המשחקים המקוריים ללא עריכה מסיבית.

האם החומר מתאים למוצרים הפונים לקהל הרחב?

ממש לא. כרטיס המאגר מזהיר במפורש שהתוכן מגיע ממשחקים למבוגרים וכולל נושאים מטרידים, אלימים וקיצוניים. אימון מודל על הנתונים הללו ללא סינון עמוק ייצר פלט שאינו מתאים למוצרי צריכה סטנדרטיים.

איך טוענים

הגישה למאגר פתוחה ישירות ב־Hugging Face ללא צורך בהרשמה מיוחדת או אישור מראש. הנתונים מפוזרים בין 1,360 קבצים בפורמטים שונים, בעיקר קובצי txt, קבצים מכווצים בסיומת txt.gz, וקובץ statistic.xlsx בתיקיית התצוגה המקדימה שמפרט את הנתונים. בגלל המבנה המבוזר לפי קבצים נפרדים ולא בפורמט אחיד כמו jsonl או parquet, הטעינה דרך הספרייה הרגילה עשויה לדרוש כתיבת סקריפט ייעודי שיקרא את קובצי הטקסט ישירות ויחלץ את השדות הרלוונטיים.

from datasets import load_dataset

ds = load_dataset("Limour/b-corpus")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי מכל סוג, הן בנתונים עצמם והן בכל מודל או תוצר שנגזר מהם. חובה לתת קרדיט למפרסם, וכל נגזרת חייבת להיות משותפת תחת אותו רישיון בדיוק. אם אתם בונים מודל למוצר מסחרי, המאגר הזה פסול לשימוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗