GPT
C

CommonCrawl-CreativeCommons

קוד פתוח

BramVanroycc2025-01-28

טקסט גולמי מתוך קומונקראול שסומן עם סוגי רישיונות קריאייטיב קומונס ספציפיים. מי שרוצה לאמן מודלים על נתוני רשת בלי להסתבך עם זכויות יוצרים עמומות ימצא כאן תשתית ממוינת.

  • 3,030הורדות בחודש
  • 40לייקים

מה זה

המאגר מכיל 147,733,367 מסמכים שמקורם בשבעה מחזורי סריקה שונים של קומונקראול, החל מ־2019 ועד תחילת 2025. כל רשומה כוללת את הטקסט הגולמי כפי שנשלף מהאתר המקורי ללא עריכה, לצד מזהה הרשומה, כתובת הרשת, תאריך הסריקה, השפה שזוהתה באמצעות glotlid, ומידע מפורט על הרישיון שנמצא בדף.

בניגוד לשיטות סינון קודמות שמסתמכות על ביטויים רגולריים, כאן בוצע ניתוח מבני מלא של עץ ה־HTML. המנתח בדק היכן בדיוק הופיע הקישור לרישיון, בראש הדף, בתגיות מטא, בתוך קוד JSON-LD או בהערות השוליים התחתונות. המיקום קובע את רמת האמינות, ורשומות עם סתירות בין רישיונות שונים באותו עמוד מסומנות בעמודות ייעודיות לצורך סינון קל.

מתאים ל

  • אימון מודלי שפה מסחריים

    סינון קפדני של רשומות המכילות רישיונות פתוחים בלבד מאפשר אימון מודלים ללא חשש מתביעות על שימוש לא מסחרי.

  • מחקר על זכויות ברשת

    ניתוח מטא-דאטה לבדיקת אופן ההפצה של תוכן ברישיונות פתוחים ברחבי האינטרנט לפי שפות ותקופות זמן.

  • טיוב וניקוי דאטה ייעודי

    שימוש בטקסט הגולמי כבסיס לבניית מאגרי אימון איכותיים באמצעות פילטרים פרטיים של כפילויות ותוכן ירוד.

איפה זה נופל

הטקסט במאגר גולמי לחלוטין. לא בוצע שום סינון איכות, לא נבדקה רמת הקריאות, והנתונים לא עברו ניכוי כפילויות, כך שכל עבודת הניקוי מוטלת עליכם. חצי מהחומר הוא באנגלית, כמות עצומה מגיעה ישירות מויקיפדיה, ויש יצוג לשבע שפות אירופיות נוספות בלבד, ביניהן גרמנית, צרפתית והולנדית. עברית לא קיימת כאן בכלל. יש גם מקרים של זיהוי שגוי שבהם קישור לרישיון בתחתית הדף נוגע בכלל לתמונה או מופיע סתם בתוך מאמר, והכרטיס מדגיש שחובה לסנן ידנית רישיונות לא מסחריים כמו NC אם המטרה היא מוצר מסחרי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הדבר תלוי לחלוטין באופן הסינון שלכם. המאגר כולל את כל סוגי הרישיונות של קריאייטיב קומונס, כולל רישיונות NC שאוסרים שימוש מסחרי ורישיונות SA שמחייבים פתיחת קוד ומשקלים. אם תסננו החוצה את הרישיונות המגבילים בעזרת שדות הרישיון המובנים, תוכלו להשתמש בחלקים המתאימים.

האם יש במאגר טקסטים בעברית?

לא. הדאטהסט מכיל אך ורק שמונה שפות שנסרקו ועובדו: אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, הולנדית, אפריקאנס ופריזית. עברית כלל לא נכללת ברשימת השפות הזמינות בגרסה הזו.

במה הוא שונה ממאגרים כמו FineWeb או דולמה?

ההבדל העיקרי הוא בשיטת החילוץ של הרישיון. במקום להריץ חיפוש ביטויים רגולריים פשוט על הטקסט, כאן בוצע ניתוח של עץ ה־HTML כדי לדעת איפה הרישיון ישב בדף, מה שמצמצם זיהויים שגויים. מצד שני, המאגר הזה שומר על הטקסט הגולמי לחלוטין ולא מבצע שום סינון איכות או ניכוי כפילויות מראש.

כמה נתונים יש במאגר ואיך מתמודדים עם הנפח?

המאגר כולל 147,733,367 מסמכים ויותר מ־149 מיליארד טוקנים המחולקים ל־300 קבצים. הורדה של הכל בבת אחת אינה מעשית לרוב המחשבים הרגילים, ולכן מומלץ להשתמש בפרמטר ההזרמה של huggingface או למשוך רק חלוקות ספציפיות לפי שפה ומועד סריקה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset רגילה עם הנתיב BramVanroy/CommonCrawl-CreativeCommons. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין. בגלל הגודל, 149 מיליארד טוקנים המחולקים ל־300 קבצי parquet, חובה לעבוד עם הזרמה באמצעות הפרמטר streaming שווה ל־True, אלא אם מורידים מראש תת-קבוצה מוגדרת לפי סריקה או שפה בודדת. בעבודה השוטפת, השדות החשובים לסינון מקדים הם text, license_abbr, license_disagreement ו־license_location.

from datasets import load_dataset

ds = load_dataset("BramVanroy/CommonCrawl-CreativeCommons")

הרישיון

המאגר עצמו מקוטלג תחת רישיון cc, אבל בפועל כל רשומה בפנים נושאת רישיון פרטני משלה. יש שם הכל: מנחלת הכלל ועד רישיונות מגבילים שאוסרים שימוש מסחרי, מחייבים ייחוס, או דורשים שיתוף זהה של תוצרים נגזרים. אימון מודל על כל הדאטהסט ללא סינון יחשוף אתכם לרישיונות NC ו־SA. כדי לבנות מודל מסחרי חופשי, חובה לסנן את הרשומות לפי עמודת license_abbr ולעבוד רק עם טקסטים ברישיון מתאים.

הרישיון המלא ב־Hugging Face ↗