GPT
F

Fineweb-Edu-Chinese-V2.2

קוד פתוח

opencsgapache-2.02026-01-30

  • education
  • nlp
  • sft
  • synthetic
  • deepseek

המאגר מרכז 1.43 מיליון זוגות שאלות ותשובות בסינית לצד חומרי קדם אימון מדורגים. הוא נועד למי שרוצה לדייק מודל שפה בסינית על בסיס טקסטים עובדתיים בלי להסתמך על שיחות רשת רועשות.

  • 3,614הורדות בחודש
  • 83לייקים

מה זה

המאגר מחולק לשני עולמות תוכן עיקריים, קדם אימון והוראות כוונון. רכיב ההוראות כולל 1.43 מיליון שורות של שאלות ותשובות שנוצרו באמצעות המודל DeepSeek V3.2 מתוך האלפיון העליון של קטעי הטקסט האיכותיים ביותר. התשובות עוגנו ישירות בטקסט המקור כדי לצמצם הזיות. לצד גרסת הכוונון הנקייה שכוללת רק פקודה ופלט, ישנו קובץ מקביל המכיל גם את טקסט המקור המלא לצורכי מעקב ואימות.

רכיב קדם האימון, שמקורו בגרסה הקודמת של הפרויקט, כולל היקף של כ־1.5 טריליון טוקנים שנאספו ממקורות רשת וטקסטים בסינית כמו Industry2, wanjuan1.0, wudao, map-cc ו־opencsg-cc. החומרים עברו סינון ודירוג איכות באמצעות מודל ייעודי של OpenCSG, ומחולקים לשלוש שכבות איכות: שכבת עילית בנפח 70 גיגה בייט עם ציונים 4 עד 5, שכבת ביניים בנפח 800 גיגה בייט עם ציונים 3 עד 4, ושכבת רקע בנפח 1.4 טרה בייט עם ציונים 2 עד 3.

מתאים ל

  • כוונון הוראות בסינית

    אימון מודלים קיימים לענות על שאלות ידע מורכבות בסינית בעזרת 1.43 מיליון זוגות שאלות ותשובות מובנים.

  • שלב הצינון בקדם אימון

    שימוש ב־70 גיגה בייט של טקסטים ברמת איכות הגבוהה ביותר לשלב הסיום של קדם אימון להורדת מדד המבוכה.

  • אימות עובדתי ומחקר נתונים

    הצלבת פלטים של מודלים מול קובץ ההקשר המלא כדי לחקור כיצד סינתוז מודל משפיע על שמירת עובדות מהמקור.

איפה זה נופל

כל התוכן במאגר כתוב בסינית בלבד, כך שהוא חסר תועלת לחלוטין למי שמחפש עברית או אנגלית. רכיב הכוונון נשען כולו על נתונים סינתטיים שנוצרו על ידי מודל יחיד, DeepSeek V3.2, מה שעלול לייצר דפוס תשובה אחיד מדי. בנוסף, חלקי קדם האימון העצומים מכילים טקסטים מהרשת שמחייבים בדיקה מקומית של תקינות, רגישות וזכויות יוצרים לפני שדוחפים אותם למוצר ייצורי.

אותה משפחה

Fineweb-Edu-Chinese יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הכרטיס מציין תמיכה בשימוש מסחרי, אך הוא מתנה זאת בעמידה ברישיון הקהילה של OpenCSG ובקבלת אישור בדוא"ל לפני השימוש. למרות התיוג של Apache 2.0, חובה לפנות למפרסמים כדי לקבל היתר.

האם יש במאגר נתונים בעברית?

לא. המאגר מוגדר לשפה הסינית בלבד וכל מקורות הטקסט וזוגות השאלות והתשובות מיועדים למודלים בסינית.

כמה שוקל הדאטהסט ומה דרישות האחסון?

גרסת השאלות והתשובות לכוונון שוקלת 3.4 גיגה בייט בלבד, וקובץ ההקשר המלא שוקל 14.6 גיגה בייט. אם רוצים להוריד את כל נתוני קדם האימון מחולקים לפי ציונים, מדובר במעל 2.2 טרה בייט המפוזרים על פני אלפי קובצי Parquet.

מאיפה הגיעו הטקסטים של הדאטהסט?

טקסט הבסיס נאסף ממאגרי רשת פתוחים בסינית כגון wudao, wanjuan1.0 ו־SkyPile, ועבר סינון איכות. מתוך החומר המסונן נלקחו הקטעים המובילים, ועליהם הופעל המודל DeepSeek V3.2 ליצירת שאלות ותשובות.

איך טוענים

טוענים את החלקים השונים ישירות דרך ספריית datasets בפייתון, ללא צורך באישור גישה מוקדם בדף המאגר. עבור כוונון מודלים, טוענים את הפיצול הייעודי sft_qa ששוקל 3.4 גיגה בייט וכולל את השדות instruction ו־output. אם נתקלים בתשובות מוזרות ורוצים לבדוק את המקור, טוענים את הפיצול sft_context ששוקל 14.6 גיגה בייט. מי שמתכנן עבודת קדם אימון מלאה צריך לקחת בחשבון עשרות אלפי קובצי Parquet בנפח כולל של מעל 2 טרה בייט, אותם טוענים לפי חלוקת הציונים.

from datasets import load_dataset

ds = load_dataset("opencsg/Fineweb-Edu-Chinese-V2.2")

הרישיון

המטא דאטה מציג רישיון Apache 2.0, אך הכרטיס עצמו מטיל הגבלה נוספת ודורש לפעול לפי רישיון הקהילה של OpenCSG. שימוש מסחרי במאגר או במודלים שנגזרו ממנו מחייב שליחת דוא"ל לחברה וקבלת אישור מפורש מראש. מצב זה שולל שימוש חופשי ומחייב בדיקה משפטית לפני שילוב בפרויקט מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗