GPT
C

CCI2-Data

קוד פתוח

BAAIרישיון לא דווח2024-04-17

קורפוס ענק של טקסט סיני מסונן מהרשת, שמיועד למי שמאמן מודלי שפה ומחפש חומר נקי מספאם ובעיות בטיחות. המאגר מתמקד במקורות אמינים ועבר סינון מבוסס מודלים וחוקים.

  • 3,424הורדות בחודש
  • 57לייקים

מה זה

מדובר במאגר טקסט גולמי המיועד לאימון מודלים בשפה הסינית בלבד. כל רשומה במאגר מייצגת מסמך שלם מהאינטרנט, ומכילה בסך הכל שני שדות פשוטים: מזהה ייחודי מסוג מחרוזת, ותוכן הטקסט המלא של אותו מסמך. לפי התיעוד, הטקסטים נאספו ממקורות רשת שנחשבים אמינים, אך המפרסמים אינם מפרטים מהם אותם מקורות ספציפיים או מאיזה אתרים המידע נגרד.

העיבוד של הנתונים כלל שלושה שלבים מרכזיים לפני הפרסום. תחילה הופעל סינון מבוסס חוקים שנועד להסיר תוכן בעייתי מבחינת בטיחות ומידע ספאמי באמצעות מילות מפתח. לאחר מכן הופעל מודל סיווג ייעודי שסילק טקסטים באיכות נמוכה. השלב השלישי כלל הסרת כפילויות, גם בתוך המאגר עצמו וגם מול מאגרי נתונים קודמים. המבנה אינו מחולק לתתי קבוצות של אימון ובדיקה, אלא מוגש כמקשה אחת של קובצי נתונים בפורמט פרקט.

מתאים ל

  • אימון מקדים של מודלי שפה

    הזנה של טקסט סיני מסונן בהיקף גדול לשלבי הקדם אימון של מודלי יצירת טקסט.

  • הערכת ביצועים בסינית

    בדיקת איכות השפה והדקדוק של מודלים קיימים מול טקסטים מודרניים שנאספו מהרשת.

  • אימון מסווגי איכות טקסט

    שימוש בנתונים כדוגמה חיובית לתוכן שעבר ניקוי ספאם והסרת כפילויות.

איפה זה נופל

המאגר מכיל אך ורק סינית, כך שאין בו תועלת ישירה לעבודה בעברית או באנגלית. הכרטיס לא מפרט אילו סוגי אתרים נסרקו, מה טווח התאריכים של הטקסטים, או מה בדיוק הגדיר המודל כתוכן בטוח או איכותי. ייתכנו הטיות תרבותיות ופוליטיות שנובעות מהרגולציה וממנגנוני הצנזורה על הרשת בסין, ולכן חובה לבדוק מדגמית את הפלטים לפני שמשלבים מודל כזה בסביבת ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא ברור מהעמוד. הרישיון הרשמי לא מוגדר בהאגינג פייס, והיוצרים מפנים להסכם שימוש חיצוני בקישור חיצוני. מומלץ לקרוא את ההסכם שלהם לפני שמשקיעים משאבי אימון למטרות רווח.

האם יש בדאטהסט טקסטים בעברית?

לא. המאגר מוגדר ומיועד לשפה הסינית בלבד.

כמה שטח אחסון צריך כדי להוריד אותו?

נפח הקורפוס כולו עומד על 501GB. הקבצים מחולקים לכ־179 קובצי פרקט נפרדים.

איך המידע נאסף ונוקה?

הטקסטים נאספו ממקורות רשת מהימנים לפי הגדרת היוצרים. הם עברו סינון לפי מילות מפתח לחסימת ספאם, סינון איכות בעזרת מודל סיווג, ותהליך הסרת כפילויות.

איך טוענים

טוענים את המאגר ישירות בספריית datasets בעזרת הפקודה load_dataset עם המזהה BAAI/CCI2-Data. אין צורך לבקש אישור גישה מראש בהאגינג פייס, אך נפח המאגר מגיע ל־501GB והוא מפוצל ל־179 קובצי פרקט, כך שנדרש חיבור מהיר והרבה מקום פנוי בדיסק. השדות שמוחזרים הם id ו־content בלבד.

from datasets import load_dataset

ds = load_dataset("BAAI/CCI2-Data")

הרישיון

הרישיון בהאגינג פייס מוגדר כלא דווח, אך המפרסמים מפנים להסכם שימוש חיצוני באתר של BAAI. בלי רישיון קוד פתוח מוכר ומוגדר בעמוד עצמו, אין שום היתר ברור לשימוש מסחרי, ואי אפשר לדעת אילו הגבלות חלות על מודל שתאמנו על החומר הזה. מפתח ישראלי שבונה מוצר מסחרי צריך להתרחק או לקבל אישור משפטי מפורש.

הרישיון המלא ב־Hugging Face ↗