GPT
C

chinese-fineweb-edu

קוד פתוח

opencsgapache-2.02024-08-26

קורפוס אימון בסיסי בסינית עם כ־90 מיליון רשומות חינוכיות מסוננות. הוא מתאים למי שרוצה להרים מודל שפה בסינית תוך חיסכון במשאבים, בזכות דאטה באיכות גבוהה.

  • 13,997הורדות בחודש
  • 116לייקים

מה זה

המאגר מכיל טקסטים בסינית שנאספו מחמישה קורפוסים מרכזיים ברשת: CCI2-Data, SkyPile-150B, IndustryCorpus, TeleChat-PTD ו־MAP-CC. במקור מדובר בטקסטים מגוונים מאינדסטרי, רשת ותקשורת, בהיקף עצום של מיליארדי טוקנים.

כדי לבודד רק תכנים בעלי ערך לימודי, OpenCSG השתמשו במודל csg-wukong-enterprise כדי לדרג 100 אלף דוגמאות בסולם של אפס עד חמש. על הדוגמאות האלה אימנו מודל BERT ייעודי, שסרק את כל הדאטה הגולמי ושמר רק קטעים שקיבלו ציון 4 ומעלה, כלומר רמת בהירות וחומר המתאימים לבית ספר יסודי או תיכון. לבסוף, הטקסטים עברו ניקוי כפילויות באמצעות MinHash, כך שנשארו כ־90 מיליון רשומות בלבד בנפח כולל של כ־300GB.

מתאים ל

  • אימון מודלי שפה בסינית

    אימון מקדים של מודלים מבוססי טקסט בסינית עם התמקדות בחומר קריא, מובנה ומסונן.

  • הערכת בנצ'מרקים

    שיפור התוצאות במבחני ידע והבנה בסינית כמו CEval ו־CMMLU עם פחות צעדי אימון.

  • חידוד מודלים לחינוך

    התאמת מודלים קיימים ליצירת תוכני לימוד, הסברים מודרכים ופתרון שאלות ברמת בית ספר.

איפה זה נופל

הבעיה המרכזית כאן היא שהגרסה הזו מוגדרת כ־deprecated, והיוצרים עצמם ממליצים לעבור לגרסה Fineweb-edu-chinese-v2.1. מעבר לזה, כל החומר הוא בסינית בלבד, אין כאן מילה בעברית או באנגלית, וסף הסינון התמקד בטקסטים ברמת בית ספר יסודי ותיכון, מה שעלול להשאיר בחוץ ידע מקצועי או אקדמי מתקדם.

אותה משפחה

chinese-fineweb-edu יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

באופן עקרוני כן, אך עם כוכבית משמעותית. למרות הסימון כ־Apache 2.0, היוצרים דורשים לעמוד בתנאי רישיון הקהילה שלהם ולשלוח בקשה רשמית במייל לקבלת אישור מסחרי לפני השימוש.

כמה מקום צריך בשביל להוריד אותו?

המאגר שוקל כ־300GB ומחולק על פני 310 קבצים בפורמט Parquet. כדאי להכין נפח דיסק ייעודי וחיבור רשת יציב לפני שמתחילים למשוך את כל התיקיות.

האם יש בדאטהסט טקסטים בעברית?

לא. מדובר בקורפוס שמיועד כולו לשפה הסינית ונאסף ממקורות אינטרנט סיניים בלבד, ללא ייצוג לשפות אחרות.

האם כדאי להתחיל פרויקט חדש עם המאגר הזה?

לא מומלץ. יוצרי המאגר סימנו אותו כגרסה ישנה ולא מתוחזקת, וממליצים להשתמש בגרסה החדשה יותר שפרסמו בשם Fineweb-edu-chinese-v2.1.

איך טוענים

הדאטהסט מגיע כקבצי Parquet המחולקים בין תיקיות שונות כמו IndustryCorpus, בסך הכל 310 קבצים במאגר. אין צורך בבקשת גישה מיוחדת להורדה ישירה דרך הספרייה הרגילה של Hugging Face, אבל קחו בחשבון שדרוש נפח אחסון מקומי פנוי של לפחות 300GB לפני שמתחילים לחלץ או להזרים את הטקסטים לאימון.

from datasets import load_dataset

ds = load_dataset("opencsg/chinese-fineweb-edu")

הרישיון

המאגר מוגדר ברישיון Apache-2.0, אבל הכרטיס מוסיף דרישה שסותרת את הרוח הפתוחה הרגילה. אם אתם מתכננים שימוש מסחרי במאגר או בתוצרים שלו, אתם מחויבים לציית לרישיון הקהילה של OpenCSG, לשלוח מייל לכתובת lorraineg@opencsg.com ולקבל אישור מראש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗