GPT
C

ChineseWebText

קוד פתוח

CASIA-LMרישיון לא דווח2023-11-02

מאגר ענק של טקסטים בסינית מחולצים מהרשת עם ציוני איכות מוכנים מראש. הוא מיועד למי שמאמן מודלי שפה וצריך לסנן דאטה סיני בהיקף גדול לפי רף מוגדר.

  • 7,051הורדות בחודש
  • 45לייקים

מה זה

המאגר מכיל טקסטים בסינית שחולצו מקראול הרשת של CommonCrawl באמצעות כלי עיבוד ייעודי בשם EvalWeb. סך כל הנתונים מגיע לנפח של 1.42 טרה בייט, כאשר היוצרים מציעים גם תת קבוצה נקייה יותר בנפח של 600 ג'יגה בייט, שמכילה רק טקסטים עם ציון איכות שמעל תשעים אחוז.

כל רשומה בתוך הקבצים כוללת את תוכן הטקסט המלא, כותרת, כתובת האתר המקורית, שם הדומיין שממנו העמוד נאסף וציון איכות מספרי שחושב על ידי מודל הערכה. המבנה הזה מאפשר לכם להחליט בעצמכם על איזה רף איכות לחתוך את החומר לפני שאתם מתחילים שלב אימון, בלי שתצטרכו להריץ מודל דירוג משלכם על מאות ג'יגה בייטים של דפי אינטרנט גולמיים.

מתאים ל

  • אימון מקדים של מודלי שפה

    הזנת טקסט סיני מסונן בהיקף גדול לשלבי אימון בסיסיים של מודלים חדשים.

  • מחקר על סינון דאטה

    בחינת הקשר בין ציוני איכות של מודל הערכה לביצועי מודל שפה שמתאמן עליהם.

  • התאמת מודל לשפה הסינית

    הרחבת אוצר המילים והיכולות של מודל קיים בסינית תוך שימוש בתת הקבוצה הנקייה.

איפה זה נופל

המאגר מוגבל אך ורק לשפה הסינית ולמקורות שהגיעו מסריקות של CommonCrawl, כך שאין כאן שום ייצוג לעברית, אנגלית או שפות נוספות. שמות הקבצים מעידים על נתונים שנאספו סביב שנת 2021, מה שאומר שהמידע אינו מעודכן להתרחשויות של השנים האחרונות. מעבר לכך, מודל הערכת האיכות שחילק את הציונים עלול לשקף הטיות ספציפיות בבחירת התכנים, וחשוב לבדוק מדגמית מה נפסל ומה עבר את הציון הגבוה לפני שמכניסים את החומר לאימון של מודל פרודקשן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון לא דווח בכרטיס המאגר. במצב כזה אין הרשאה משפטית מפורשת לשימוש מסחרי, וכל שימוש כזה כרוך בסיכון של הפרת זכויות יוצרים. מומלץ להיצמד לצרכים מחקריים בלבד.

כמה שטח אחסון צריך בשביל לעבוד איתו?

המאגר המלא דורש 1.42 טרה בייט של נפח דיסק פנוי. אם בוחרים להוריד רק את תת הקבוצה שסוננה לרמת איכות גבוהה, מדובר בכ 600 ג'יגה בייט. בשני המקרים דרושה תשתית אחסון מהירה.

האם יש במאגר טקסטים בעברית?

המאגר מיועד אך ורק לטקסטים ברשת בשפה הסינית. אין בו נתונים בעברית, ואי אפשר להשתמש בו ללימוד השפה העברית או לאימון עליה.

מאיפה הנתונים נאספו?

הטקסטים חולצו מתוך מאגרי הקראול של CommonCrawl באמצעות כלי עיבוד שפיתחו החוקרים בשם EvalWeb. כל רשומה כוללת את הכתובת והדומיין המקוריים שמהם העמוד הגיע.

איך טוענים

החומר מחולק ל 298 קבצי jsonl שמסודרים לפי תיקיות של תקופות סריקה, כמו למשל תיקיית 2021-43. המאגר ציבורי ולא דורש הרשאה מיוחדת כדי להוריד אותו, אבל מדובר ביותר מטרה בייט של מידע, כך שתצטרכו שטח אחסון רציני וחיבור מהיר כדי לעבוד איתו. בקוד הטעינה כדאי לקרוא ישירות את השדות text ו score כדי להחיל סינון לפי סף האיכות שמתאים לפרויקט שלכם עוד לפני ששומרים את הטוקנים.

from datasets import load_dataset

ds = load_dataset("CASIA-LM/ChineseWebText")

הרישיון

היוצרים לא דיווחו על רישיון שימוש בעמוד המאגר. כשאין רישיון מוגדר, מבחינה משפטית אין היתר ברור לשימוש מסחרי, להפצה מחדש או לאימון מודלים שמיועדים למוצר מסחרי. מי שבוחר לאמן על המידע הזה עושה זאת בסיכון משפטי, והשימוש הבטוח ביותר מוגבל למחקר אקדמי בלבד.

הרישיון המלא ב־Hugging Face ↗