GPT
C

chinese-fineweb-edu-v2

קוד פתוח

opencsgapache-2.02024-10-13

זהו מאגר עצום של טקסטים בסינית שעברו סינון איכות קפדני לפי ערך חינוכי. מי שמפתח או מאמן מודלים שצריכים הבנה מעמיקה בסינית ימצא פה חומר גלם נקי יחסית מתוכן זבל רשתי.

  • 27,884הורדות בחודש
  • 74לייקים

מה זה

המאגר מכיל 188 מיליון רשומות טקסט שמסתכמות בערך ב־420 מיליארד טוקנים. הטקסטים נאספו ממאגרים סיניים רחבים קיימים כמו Industry2, CCI3, michao, wanjuan1.0, wudao וכן ChineseWebText, במטרה לכסות תעשיות ותחומים מגוונים ברשת.

כדי לסנן את המידע, המפתחים השתמשו במודל שנקרא csg-wukong-enterprise V2. המודל דירג קטעי אינטרנט בסולם של אפס עד חמש לפי איכות הכתיבה, רמת הלכידות והערך הלימודי, כאשר קטעים עם פרסומות או תוכן ירוד קיבלו ציונים נמוכים. רק רשומות שקיבלו ציון 3 ומעלה, כלומר טקסטים קוהרנטיים ברמה של ספרי לימוד או מידע שימושי מובנה, נכנסו למאגר הסופי לאחר ניקוי וכפילויות.

מתאים ל

  • אימון מקדים למודלי שפה

    חומר בסיס נקי ורחב של מאות מיליארדי טוקנים לאימון מודלים שצריכים שליטה גבוהה בסינית.

  • התאמה לעולם החינוך וההדרכה

    אימון והתאמה של מודלים שמיועדים להסברת מושגים, הפקת חומרי לימוד או מענה לשאלות מורכבות.

  • סינון וטיוב נתונים

    שימוש בטקסטים שקיבלו ציון גבוה כמדד איכות לבניית מסננים ומודלי דירוג פנימיים לארגון.

איפה זה נופל

המאגר כולו בסינית, בלי עברית ובלי תמיכה בשפות אחרות. מעבר לזה, המפרסמים מציינים במפורש שהגרסה הזו מוגדרת deprecated, וממליצים לעבור לגרסה 2.1. הסינון התבסס לחלוטין על מודל אוטומטי ופרומפטים שחיפשו טקסט לימודי, כך שחומרים שאינם כתובים בסגנון פדגוגי נחתכו החוצה, ועשויות להישאר הטיות שמקורן במודל השופט או במאגרי המקור הסיניים.

אותה משפחה

chinese-fineweb-edu יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

למרות הסימון של רישיון Apache 2.0, היוצרים דורשים לפעול לפי רישיון הקהילה שלהם. כדי להשתמש בנתונים או בתוצרים שלהם באופן מסחרי, חובה לשלוח מייל לכתובת של OpenCSG ולקבל מהם אישור כתוב מראש.

האם יש במאגר טקסטים בעברית?

לא, המאגר מיועד כולו לשפה הסינית וכולל רשומות שמקורן באתרים ובמאגרים סיניים בלבד. אם המודל שלכם דורש עברית, הדאטהסט הזה לא יתרום לו דבר.

האם כדאי להתחיל פרויקט חדש על הגרסה הזו?

לא מומלץ להתחיל ממנה כעת. יוצרי המאגר הכריזו עליה כלא עדכנית והוציאו במקומה את גרסה 2.1, ולכן עדיף לגשת ישירות לגרסה החדשה.

איך בוצע הסינון של הטקסטים בפועל?

החוקרים לקחו נתונים ממאגרי רשת סיניים גדולים והריצו עליהם מודל שיפוט שבדק ערך לימודי, בהירות ואיכות כתיבה בסולם של 0 עד 5. רק קטעים שקיבלו ציון 3 ומעלה נשמרו, בעוד שפרסומות ותכנים לא רלוונטיים נזרקו.

איך טוענים

הנתונים מפוצלים ל־631 קבצי parquet בספריית data, ללא צורך באישור גישה מיוחד כדי להוריד אותם ישירות מ־Hugging Face. בגלל שמדובר במאות מיליארדי טוקנים, תצטרכו שטח אחסון גדול מאוד ותשתיות שמסוגלות לעבד קבצים במקביל, או להשתמש בהזרמה ישירה בקוד במקום להוריד הכל מראש לדיסק.

from datasets import load_dataset

ds = load_dataset("opencsg/chinese-fineweb-edu-v2")

הרישיון

הרישיון הרשמי בעמוד הוא apache-2.0, שמאפשר שימוש חופשי ושינויים, אך הטקסט של היוצרים מוסיף התניה קריטית. אם אתם מתכננים שימוש מסחרי במאגר או בתוצרים שלו, אתם מחויבים לציית לרישיון הקהילתי של OpenCSG ולשלוח אליהם מייל כדי לקבל אישור מפורש מראש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗