GPT
M

MAP-CC

קוד פתוח

m-a-pcc-by-nc-nd-4.02024-04-02

מאגר ענק של 800 מיליארד תוקנים בסינית לאימון מקדים של מודלי שפה. הוא מיועד למי שבונה מודל ייעודי למזרח אסיה וצריך כיסוי רחב של מקורות רשת, אנציקלופדיות וספרים.

  • 5,210הורדות בחודש
  • 83לייקים

מה זה

המאגר כולל טקסטים מחמישה מקורות שונים שנאספו עבור פרויקט אימון מודלים בסינית. החלק של zh-cc מבוסס על חילוץ וסינון של תוכן סיני מתוך Common Crawl וכולל אתרי חדשות, בלוגים ודפי אינטרנט כלליים. החלקים האחרים מביאים טקסט מובנה יותר, כמו ערכים מאנציקלופדיות סיניות מגוונות ב־zh-baike ומאמרים אקדמיים מתחומים שונים ב־zh-papers.

שאר הדאטה כולל טקסטים מספרים שיצאו לאור בסינית תחת zh-books, כולל ספרי לימוד וספרות יפה, וכן קטגוריה של zh-others שמרכזת בעיקר נתוני שאלות ותשובות. המפרסמים מציינים שהנתונים עברו בדיקות תאימות קפדניות, אך הכרטיס אינו מפרט את שלבי הניקוי, הסרת הכפילויות או הכללים הטכניים המדויקים ששימשו לעיבוד הטקסט הגולמי.

מתאים ל

  • אימון מקדים למחקר

    אימון מודלי שפה בסינית בקנה מידה גדול במסגרת אקדמית שאינה מסחרית.

  • מחקר בלשני על טקסט סיני

    ניתוח סגנונות כתיבה ודפוסי שפה במעבר בין מאמרים, ספרים וטקסטים מהרשת.

  • אימון מערכות שאלות ותשובות

    שימוש בחלק של zh-others לבנייה והערכה של מודלים שמיועדים למענה על שאלות.

איפה זה נופל

המאגר מכיל תוכן בסינית בלבד ואין בו שום ייצוג לעברית או לשפות אחרות. מעבר לכך, הכרטיס מודה בפירוש שאי אפשר להבטיח את הדיוק או ההלימות של המידע בכל תרחיש, ומתנער מכל אחריות על שגיאות, מידע מוטעה או בעיות אבטחת מידע. תאריכי האיסוף המקוריים של הספרים, המאמרים ודפי הרשת אינם מצוינים, כך שקשה לדעת עד כמה התוכן עדכני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא, הרישיון אוסר זאת במפורש. המאגר מופץ תחת רישיון CC BY-NC-ND 4.0 שמיועד לשימוש אקדמי ולימודי בלבד. שימוש בנתונים לצורך מסחרי מפר את תנאי היוצרים.

האם המאגר כולל טקסטים בעברית?

אין במאגר עברית בכלל. כל הנתונים מורכבים מחומרים בשפה הסינית מתוך אנציקלופדיות, ספרים, מאמרים ודפי רשת מקומיים. עבור פרויקטים בעברית תצטרכו לחפש מקורות אחרים לחלוטין.

איך נאספו הנתונים במאגר?

החומרים נאספו מחמישה מקורות נפרדים שכוללים את Common Crawl, מאגרים אנציקלופדיים, ספרים ומאמרים מדעיים. היוצרים מציינים שהתבצעה בדיקת תאימות של התכנים, אך הם אינם מפרטים את האלגוריתמים המדויקים לסינון.

איך טוענים את הנתונים לעבודה מקומית?

הקבצים מחולקים לחלקים קטנים בפורמט jsonl.gz שצריך להוריד בנפרד. לאחר ההורדה יש לאחד אותם באמצעות פקודת cat במסוף יוניקס לקובץ יחיד, ולאחר מכן לחלץ את הדחיסה כדי לגשת לרשומות.

איך טוענים

הקבצים מאוחסנים בארכיון מחולק לחלקים בפורמט jsonl דחוס ב־gz. אין צורך באישור גישה מיוחד כדי להוריד את המאגר, אך העבודה איתו דורשת פעולה ידנית בסביבת יוניקס. צריך להוריד את כל החלקים של קטגוריה מסוימת, לאחד אותם לפייל אחד בעזרת פקודת cat של קובצי ה־part, ואז לחלץ את הארכיון כדי לקרוא את השורות.

from datasets import load_dataset

ds = load_dataset("m-a-p/MAP-CC")

הרישיון

הרישיון הוא CC BY-NC-ND 4.0, וזה מציב מגבלה כבדה. השימוש מותר למטרות מחקר ואקדמיה בלבד ודורש מתן קרדיט מלא ליוצרים. אסור לעשות שימוש מסחרי מכל סוג, והסעיף של איסור יצירות נגזרות (NoDerivatives) הופך אימון של מודל מסחרי או הפצה של גרסאות מעובדות של הנתונים לעניין משפטי מסוכן מאוד.

הרישיון המלא ב־Hugging Face ↗