GPT
M

MNBVC

קוד פתוח

liwumit2023-02-13

מאגר ענק בסינית שמיועד לאימון מודלי שפה, עם חלוקה מפורטת לקטגוריות תוכן שונות. מי שמאמן מודל גנרטיבי בסינית ומחפש מגוון עצום מעבר לטקסט רשת רגיל ימצא כאן מענה רחב.

  • 96,558הורדות בחודש
  • 652לייקים

מה זה

הנתונים כוללים טקסט כללי, שאלות ותשובות, קוד, שיחות מרובות תורות, דיוני פורומים וקורפוסים מקבילים. המבנה מחולק לעשרות תתי מאגרים לפי נושאים ספציפיים, כמו מאמרים אקדמיים מתוך arXiv, דוחות כספיים של חברות, פסקי דין משפטיים, חומרי לימוד ודוחות ממשלתיים בסין, פוסטים מבלוגים, וטקסטים שנלקחו מתוך משחקי מחשב פופולריים.

חלק ניכר מהתוכן מגיע מגירוד מקורות ייעודיים כמו CommonCrawl שעבר סינון, ויקיפדיה, אתרי שאלות ותשובות כמו Zhihu, Quora וקהילות StackExchange, לצד קבצי כתוביות של סרטים ודיונים מפורומים מקומיים. ישנם גם קטעים שנוצרו באמצעות מודלים כמו ChatGPT לצד נתונים שנאספו ממאגרי קוד בגיטהאב ובגוגל קוד. ברשומות המוקדמות המבנה כולל בעיקר שדות של טקסט ומטא דאטה.

מתאים ל

  • אימון בסיס בסינית

    אימון מקדים של מודלי שפה על טקסט סיני מגוון הכולל חדשות, בלוגים ופורומים.

  • אימון מודל משפטי

    התאמת מודלים לתחום המשפט בסין באמצעות תת המאגר של פסקי דין ומסמכים רשמיים.

  • שיפור יכולות חשיבה

    אימון מודלים על נתוני שאלות, תשובות ודיוני שיחה בתחום המתמטיקה להגברת יכולת ההסקה.

איפה זה נופל

המאגר מיועד לשפה הסינית בלבד, כך שהוא לא יעזור לפרויקטים בעברית או באנגלית מעבר לקורפוסים המקבילים או הקוד. קיימת הטיה מובנית לתכנים מסין, כולל חומרי תעמולה ומסמכים ממשלתיים רשמיים, לצד שאלות סינתטיות שנוצרו במודלים חיצוניים. המפרסמים מציינים מראש שחלק מהנתונים הועלו בפורמט ישן שמועמד להחלפה, ושחלקים נרחבים של החומר הגולמי טרם עברו ניקוי סופי, מה שמחייב סינון עצמאי של רעשים, כפילויות ותוכן לא אחיד לפני שמשלבים אותו באימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן אין מגבלה על מסחור. אתם יכולים לאמן מודלים לשימוש פנימי או למוצר שנמכר ללקוחות. החובה היחידה היא לשמור על ייחוס זכויות היוצרים של הפרויקט.

האם יש במאגר טקסטים בעברית?

לא, המאגר מוגדר וממוקד כולו בשפה הסינית. הוא אינו כולל נתונים בעברית, ולכן אינו מתאים למי שמחפש קורפוס מקומי.

איך נאסף המידע?

הנתונים לוקטו ממגוון ערוצים באינטרנט הסיני, כולל סריקות CommonCrawl, אתרי קוד, פורומים, מסמכים ממשלתיים וכתוביות. חלק מהנתונים כולל גם תוכן שנוצר מלאכותית באמצעות ChatGPT.

כמה שוקל כל המאגר?

המשקל הכולל אינו מפורט בכרטיס, אך מדובר ביותר מ־24,000 קבצים מכווצים בנפח עצום. מומלץ מאוד לעבוד במצב streaming או להוריד רק את תתי המאגרים הרלוונטיים עבורכם.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset עם המזהה liwu/MNBVC. המאגר פתוח לחלוטין ואינו דורש אישור גישה מראש. בגלל היקף הנתונים והפיצול ליותר מעשרים וארבעה אלף קבצים מכווצים בפורמט jsonl.gz, מומלץ להשתמש בטעינה רציפה באמצעות הפרמטר streaming כדי לקרוא רשומות בזו אחר זו במקום להוריד הכל לדיסק. בנוסף, חובה לציין את שם תת המאגר הרצוי, כמו academic_paper או law_judgement, כדי למשוך את התחום הרלוונטי בלבד.

from datasets import load_dataset

ds = load_dataset("liwu/MNBVC")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי, הפצה ושילוב במערכות סגורות, ללא חובה לשתף את המודל המאומן או את הנגזרות תחת אותו רישיון. הדרישה היחידה היא לכלול את הודעת זכויות היוצרים ואת תנאי הרישיון המקוריים בכל עותק של הקוד או של חלקי המאגר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗