GPT
F

Fineweb-Edu-Chinese-V2.1

קוד פתוח

opencsgapache-2.02025-01-15

מאגר ענק של טקסטים בסינית שמיועד לאימון מודלי שפה בתחום החינוך. הוא מחולק מראש לפי ציוני איכות, כך שאפשר לחסוך זמן חישוב ולהתמקד רק בתוכן ברמה גבוהה.

  • 44,476הורדות בחודש
  • 79לייקים

מה זה

המאגר מכיל קורפוס טקסטואלי רחב בסינית שנאסף ממקורות רשת, כולל המקורות map-cc ו־opencsg-cc שנוספו בגרסה זו. הטקסטים מיועדים למשימות יצירת טקסט ואימון מודלים בחינוך.

התוכן מסודר בתיקיות לפי ציוני איכות חינוכיים. שכבת האיכות הגבוהה ביותר כוללת ציונים בין 4 ל־5 עם טקסטים בהירים וקוהרנטיים, בהיקף של כ־70 גיגה-בייט וכ־46 מיליארד טוקנים. שכבת הביניים של ציונים בין 3 ל־4 תופסת כ־800 גיגה-בייט עם כ־530 מיליארד טוקנים ומכילה בעיות קלות של לכידות, ואילו השכבה הנמוכה יותר של ציונים בין 2 ל־3 שוקלת 1.4 טרה-בייט עם כ־930 מיליארד טוקנים.

מתאים ל

  • אימון מודל שפה בסינית

    אימון מקדים או המשך אימון של מודל שפה תוך שימוש בחלקים האיכותיים בדירוג 4 עד 5.

  • אימון מודלים לחינוך

    בניית מודלי שפה ייעודיים לתחום החינוך וההוראה בסינית תוך ניצול סינון התוכן המובנה.

  • מחקר על איכות דאטה

    השוואת ביצועי מודלים שמתאמנים על רמות איכות שונות של טקסט באמצעות החלוקה לציונים.

איפה זה נופל

המאגר כולו בסינית בלבד, ללא שום ייצוג לעברית או לשפות אחרות. מעבר לכך, חלק ניכר מהנתונים נמצא בטווח הציונים הנמוך של 2 עד 3, והיוצרים עצמם מודים שיש בו מגבלות בולטות ברמת התוכן. שימוש בחלקים האלה ללא סינון נוסף עלול לפגוע באיכות הפלט של המודל.

אותה משפחה

Fineweb-Edu-Chinese יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר באופן מסחרי?

המאגר תומך בשימוש מסחרי, אך הוא דורש אישור מפורש מראש. כדי להשתמש בו או במודלים שאומנו עליו למטרות מסחריות, עליכם לפנות בדוא"ל לכתובת lorraineg@opencsg.com ולקבל אישור בהתאם לתנאי הרישיון שלהם.

כמה נפח אחסון צריך כדי להוריד אותו?

המאגר כולו שוקל מעל 2.2 טרה-בייט ומורכב מ־29,286 קובצי Parquet. אם המשאבים שלכם מוגבלים, אפשר להוריד רק את תיקיית האיכות הגבוהה ששוקלת 70 גיגה-בייט בלבד.

האם יש במאגר נתונים בעברית?

לא. המאגר מיועד ספציפית לעיבוד שפה טבעית בסינית ומכיל טקסטים בשפה זו בלבד.

מאיפה הגיעו הנתונים?

הנתונים מבוססים על קורפוסים שנאספו מהרשת, בתוספת שני מקורות חדשים שהוטמעו בגרסה הזו: map-cc ו־opencsg-cc. כל הטקסטים עברו דירוג איכות וסווגו לתיקיות לפי התאמתם לתחום החינוך.

איך טוענים

הנתונים מחולקים לעשרות אלפי קובצי Parquet לפי תיקיות של טווחי ציונים. ההורדה המלאה דורשת מעל שני טרה-בייט של נפח אחסון פנוי, אבל החלוקה לתיקיות מאפשרת למשוך ישירות רק את התיקייה האיכותית של ציוני 4 עד 5 ששוקלת 70 גיגה-בייט בלבד. אין צורך באישור גישה מראש כדי להוריד את הקבצים.

from datasets import load_dataset

ds = load_dataset("opencsg/Fineweb-Edu-Chinese-V2.1")

הרישיון

הרישיון המוצהר במטא-דאטה הוא Apache 2.0, אך הכרטיס מציב סייג משמעותי. שימוש מסחרי במאגר או בתוצרים שנגזרו ממנו מחייב ציות לתנאי קהילת OpenCSG ודורש שליחת דוא"ל מראש לקבלת אישור מסחרי רשמי מהיוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗