GPT
C

legacy-datasets/c4

קוד פתוח

legacy-datasetsodc-by2022-03-02

מאגר ענק של טקסט רשת באנגלית שעבר ניקוי וסינון מתוך Common Crawl. מיועד בעיקר למי שמאמן מודלי שפה מאפס וצריך חומר קריאה מגוון בנפח עצום.

  • 14,734הורדות בחודש
  • 242לייקים

מה זה

הנתונים נלקחו מסריקת הרשת הציבורית של Common Crawl ועברו היוריסטיקות לניקוי קוד, תבניות אתרים וג'יבריש, לצד הסרת כפילויות נרחבת. כל רשומה כוללת טקסט נקי, כתובת המקור וחותמת זמן. הכרטיס מציין שנעשה שימוש בספריית זיהוי שפה כדי להשאיר רק דפים עם סבירות של 99 אחוז לפחות לאנגלית.

המאגר מחולק לארבע גרסאות שונות. גרסת ברירת המחדל באנגלית שוקלת 305 ג'יגה בייט בפורמט JSON ומכילה מעל 364 מיליון רשומות אימון. גרסת noblocklist שוקלת 380 ג'יגה בייט וכוללת עוד כ־28 מיליון רשומות, מכיוון שנוטרל בה הסינון שהסיר מסמכים עם מילים מרשימת ביטויים גסים. גרסת noclean מגיעה לגודל של 2.3 טרה בייט ללא הניקויים העיקריים, וגרסת realnewslike הקטנה שוקלת 15 ג'יגה בייט עם כ־13.8 מיליון רשומות המדמות טקסט חדשותי.

מתאים ל

  • אימון מקדים למודלי שפה

    הזנת כמויות ענק של טקסט רשת מגוון באנגלית ללימוד תחביר וייצוגי שפה כלליים.

  • אימון מודלים מבוססי מסיכה

    השלמת מילים וטקסטים חסרים על גבי מיליוני מסמכים ברמת שפה טבעית.

  • בדיקת ביצועי סינון תוכן

    השוואה בין הגרסה המסוננת לגרסת noblocklist כדי לבחון השפעת חסימת מילים.

איפה זה נופל

המאגר מכיל אנגלית בלבד ואין בו עברית כלל. סינון השפה התבסס על זיהוי אוטומטי שמשליך כל מה שלא זוהה ברמת ודאות של 99 אחוז, מה שמוחק לחלוטין טקסטים רב-לשוניים או שילובים מקומיים. מעבר לכך, הכרטיס מציין במפורש שאין מידע על הטיות, פרטיות או מידע רגיש, ולכן האחריות לבדוק מה נכנס למודל שלכם נופלת עליכם. סינון המילים הגסות בגרסה הרגילה עלול להעיף גם טקסטים לגיטימיים שעוסקים בנושאים רגישים.

שאלות
נפוצות

האם יש במאגר טקסט בעברית?

לא. המאגר סונן מראש באמצעות כלי זיהוי שפה שהשאיר רק דפים שזוהו כאנגלית בסבירות של 99 אחוז ומעלה. אם אתם מחפשים מקורות לאימון עברית, הדאטהסט הזה לא מתאים.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון של המאגר הוא ODC-BY, שמאפשר שימוש מסחרי תחת מתן ייחוס מתאים. יחד עם זאת, השימוש בנתונים כפוף גם לתנאי השימוש של Common Crawl, שמהם נסרק התוכן המקורי ברשת.

כמה מקום אחסון צריך בשביל להוריד אותו?

הנפח תלוי בגרסה שתבחרו להוריד. הגרסה האנגלית הנקייה שוקלת 305 ג'יגה בייט, גרסת noblocklist שוקלת 380 ג'יגה בייט, הגרסה הלא נקייה מגיעה ל־2.3 טרה בייט, וגרסת החדשות שוקלת 15 ג'יגה בייט בלבד.

למה מופיעה הודעה שהדאטהסט מיושן?

המזהה הספציפי הזה נמצא תחת legacy-datasets ומיועד למחיקה על ידי Hugging Face. המידע עבר לכתובת הרשמית והמעודכנת תחת allenai/c4, ושם מומלץ להשתמש בו לפרויקטים חדשים.

איך טוענים

הנתיב הזה מסומן כמיושן ועומד להימחק, כך שלא כדאי לבנות עליו צנרת נתונים חדשה אלא לעבור לנתיב המעודכן של allenai/c4. המאגר ציבורי ואינו דורש אישור גישה מיוחד, אך הורדה מלאה שלו דורשת מאות ג'יגה בייט של אחסון פנוי, תלוי בגרסה שתבחרו. כל מסמך מכיל שלושה שדות בלבד: url, text, ו־timestamp. בגלל המשקל העצום, מומלץ לטעון אותו בהזרמה ולא לשמור את כל הקבצים מקומית מראש.

from datasets import load_dataset

ds = load_dataset("legacy-datasets/c4")

הרישיון

המאגר מופץ ברישיון ODC-BY, שמתיר שימוש מסחרי ומחקר תמורת מתן קרדיט מתאים ליוצרים. עם זאת, השימוש כפוף גם לתנאי השימוש של Common Crawl לגבי התוכן עצמו שנאסף מהאינטרנט. המודל שאתם מאמנים לא חייב להשתחרר ברישיון פתוח זהה, אך חשוב לשמור על עמידה בתנאי המקור של איסוף התוכן.

הרישיון המלא ב־Hugging Face ↗