GPT
C

ChineseWebText2.0

קוד פתוח

CASIA-LMapache-2.02024-11-15

המאגר מרכז 3.8 טרה-בייט של טקסט רשת בסינית עם ציוני איכות, רעילות ותגיות תחום לכל רשומה. הוא מתאים למי שמאמן מודלי שפה ורוצה לסנן בעצמו את הדאטה לפי ספים מדויקים.

  • 2,130הורדות בחודש
  • 34לייקים

מה זה

המאגר התחיל מאיסוף של 6.6 טרה-בייט ממקורות רשת שונים בסינית. בשלב ההכנה נפסלו מקורות שלמים אם מעל מחצית מהתוכן בהם הוגדר לא רלוונטי, מה שהשאיר כ־67.68 אחוזים מהחומר המקורי. בהמשך הופעלו סינוני אורך, בדיקת יחס תווים חריגים כמו אנגלית וסינית מסורתית, מחיקת מילים רגישות והסרת כפילויות, עד להגעה לנפח סופי של 3.8 טרה-בייט.

כל רשומה במאגר מחזיקה את הטקסט עצמו לצד מטא-דאטה עשיר שנוצר במודלים ייעודיים. הנתונים כוללים ציון איכות מבוסס מודל BERT, סיווגי תחום של תגית בודדת ומספר תגיות שהופקו ב־FastText מתוך 11 תחומים שונים, וציון רעילות יחד עם תיוג בינארי. אנציקלופדיה, תוכן כללי וחדשות מרכיבים יחד מעל 94 אחוזים מכלל הרשומות.

מתאים ל

  • אימון מודלי שפה בסינית

    שימוש בטקסט הנקי כבסיס לקדם-אימון או להמשך אימון של מודלים בסינית מפושטת.

  • סינון דאטה מותאם אישית

    חיתוך מנות אימון לפי ספי איכות ורעילות מוגדרים מראש בעזרת הציונים המצורפים.

  • מחקר בטיחות ורעילות

    ניתוח והערכה של תוכן פוגעני ברשת באמצעות תת-המאגר שמכיל כ־1.6 מיליון רשומות רעילות.

איפה זה נופל

הסינון הראשוני הסיר בכוונה טקסטים עם שיעור גבוה של סינית מסורתית ואנגלית, מה שהופך את המאגר למוטה כמעט לחלוטין לסינית מפושטת. תחומי המתמטיקה והרפואה דלים מאוד ביחס לאנציקלופדיה וחדשות, כאשר מתמטיקה תופסת רק 0.55 אחוז מהסך הכולל. בנוסף, ציוני האיכות והרעילות נשענים על מודלי BERT ו־FastText ולא על בדיקה אנושית של כל רשומה, כך שטעויות סיווג אוטומטיות קיימות בדאטה. כרטיס המאגר גם אינו מפרט את טווח התאריכים המדויק שבו נאספו דפי הרשת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא Apache 2.0 שמתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים פנימיים או מסחריים, כל עוד אתם שומרים על תנאי הייחוס והודעות הרישיון המקוריות.

כמה שטח אחסון צריך כדי להוריד את הכל?

המאגר כולל 3.8 טרה-בייט של נתונים שמחולקים ל־167 קבצי ארכיון דחוסים. מומלץ להכין שטח אחסון פנוי של 4 טרה-בייט לפחות להורדה, והרבה יותר מזה אם אתם מתכננים לפרוס את כל קבצי ה־JSONL לדיסק מקומי.

האם יש במאגר טקסט בעברית?

לא, המאגר מיועד ספציפית לשפה הסינית. תהליך הסינון אף הסיר במכוון רשומות עם שיעור גבוה של תווים שאינם סינית מפושטת, כך שאין בו תכנים בעברית.

איך המאגר הזה שונה ממאגרי רשת סיניים אחרים?

בניגוד לסריקות רשת גולמיות, כל רשומה כאן מגיעה עם ציוני איכות ממודל שפה, סיווג ל־11 תחומים וציון רעילות. המבנה הזה חוסך את הצורך לפתח צנרת סינון נפרדת כדי לנפות תוכן ירוד לפני האימון.

איך טוענים

הנתונים מפוצלים ל־167 קבצי jsonl.gz ואינם דורשים אישור גישה מקדים. הנפח הכולל של הטקסט המעובד מגיע ל־3.8 טרה-בייט, כך שתצטרכו תשתית אחסון מתאימה ויכולת פריסה או הזרמה של קבצים דחוסים. ברמת הקוד, כל שורה היא אובייקט JSON שממנו מושכים את שדה text, ובמידת הצורך מסננים לפי quality_score, תגיות domain וציון toxicity.

from datasets import load_dataset

ds = load_dataset("CASIA-LM/ChineseWebText2.0")

הרישיון

המאגר שוחרר תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי ומחקר חופשי, מאפשר שינוי של הנתונים ואינו מחייב אתכם לשחרר מוצרים או מודלים שתאמנו תחת אותו הרישיון. הדרישה העיקרית היא הכללת עותק של הרישיון המקורי ומתן קרדיט ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗