GPT
C

CCI-Data

קוד פתוח

BAAIרישיון לא דווח2023-11-29

מאגר טקסטים בסינית של 104GB מאתרים בסין, שעבר סינון מחמיר נגד זבל והסרת דליפות מבחני ביצועים. הוא מתאים למי שמאמן מודלי שפה וצריך מקור נקי בסינית.

  • 66הורדות בחודש
  • 68לייקים

מה זה

הנתונים נאספו מאתרים ברשת של סין היבשתית בטווח זמנים שנע בין ינואר 2001 לנובמבר 2023. כל רשומה מייצגת מסמך ומכילה שלושה שדות פשוטים בלבד: מזהה ייחודי, כותרת, ותוכן הטקסט המלא.

תהליך הניקוי כלל כמה שלבים מוגדרים. המפתחים הפעילו סינון מבוסס חוקים שכלל חילוץ לפי צפיפות טקסט, הסרת מילות מפתח בעייתיות, זיהוי תוכן זבל והמרת כתב סיני מסורתי ומפושט. בנוסף, הם אימנו מודל סיווג כדי לזרוק טקסט באיכות נמוכה, ביצעו ניקוי כפילויות מלא, והריצו סינון מיוחד שמחק טקסטים מתוך מערכי הערכה ומבחנים מוכרים בסינית כדי למנוע דליפות מידע למודל.

מתאים ל

  • אימון מקדים של מודלי שפה

    הזנת טקסט סיני נקי ומפולטר בנפח 104GB למודלי יצירת טקסט חדשים.

  • התאמת מודלים קיימים לסינית

    אימון המשך על בסיס מודל קיים להרחבת אוצר המילים וההבנה של סינית מודרנית.

  • הערכת מודלים ללא זיהום נתונים

    בדיקת יכולות על טקסט אותנטי שעבר ניקוי מכוון מדליפות של מבחני ביצוע.

איפה זה נופל

המאגר מכיל אך ורק סינית. אין בו עברית, אין אנגלית ואין שפות אחרות. מעבר לכך, כל הטקסטים נאספו בלעדית מאתרים שיושבים בתוך סין היבשתית, מה שמכניס הטיה מובנית לתכנים, לצורת הניסוח ולנושאים שמותר או נהוג לפרסם שם תחת מגבלות הצנזורה המקומית. אם אתם בונים מודל כללי לקהל ישראלי או גלובלי, הדאטהסט הזה לא יעזור לבד, והוא מיועד רק למשימות שדורשות הבנה והפקה של סינית נקייה.

שאלות
נפוצות

האם יש במאגר עברית?

לא. המאגר כולל טקסטים בסינית בלבד שנאספו מאתרים ברשת של סין היבשתית. אין בו שום מידע או תוכן בעברית.

כמה המאגר שוקל בפועל?

גרסת CCI v1.0.0 שוקלת 104GB. הוא מכיל בין עשרה למאה מיליון רשומות, כך שצריך להיערך עם נפח אחסון פנוי וחיבור רשת יציב להורדה.

האם מותר להשתמש בו לצרכים מסחריים?

הרישיון בדף הרשמי לא צוין באופן פתוח. השימוש כפוף להסכם משתמש נפרד של BAAI שדורש בדיקה פרטנית, ולכן לא מומלץ להכניס אותו למוצר מסחרי בלי אימות.

איך המידע עבר סינון?

המפתחים שילבו חוקים להסרת ספאם ודחיסות מילים יחד עם מודל שסיווג וזרק תוכן באיכות ירודה. בנוסף בוצע ניקוי כפילויות יסודי והוסרו טקסטים שחופפים למבחני הערכה מוכרים.

איך טוענים

טוענים את המאגר ישירות בעזרת הפקודה load_dataset מספריית datasets עם המזהה BAAI/CCI-Data. המשקל הכולל של גרסה 1.0.0 הוא 104GB, אז חובה לפנות מספיק שטח אחסון בדיסק המקומי לפני תחילת ההורדה. אם אתם בוחרים להוריד ישירות דרך BAAI DataHub ולא דרך Hugging Face, תצטרכו לפתוח חשבון משתמש ולמלא שאלון סקר לפני שתקבלו גישה לקבצים. הרשומות מגיעות עם שדות id, title ו־content, כך שאין צורך בפרסור מורכב.

from datasets import load_dataset

ds = load_dataset("BAAI/CCI-Data")

הרישיון

הרישיון בדף המאגר לא מוגדר ישירות, ובמקום רישיון פתוח מוכר ישנו הסכם שימוש ייעודי בקובץ PDF חיצוני של BAAI. כל עוד לא קוראים ומאשרים את תנאי ההסכם הזה, אי אפשר לדעת אם מותר להשתמש במידע לאימון מודלים מסחריים או מה המגבלות על הפצת תוצרים. לשימוש מסחרי מומלץ לבדוק את המסמך מולם ישירות.

הרישיון המלא ב־Hugging Face ↗