GPT
C

cc_news

קוד פתוח

vblagojeunknown2022-03-02

מאגר של 708,241 כתבות חדשותיות באנגלית שנאספו מאתרים ברחבי העולם בין 2017 ל־2019. הוא מתאים למי שמחפש טקסט עיתונאי גולמי לאימון מודלי שפה, יחד עם מטא-דאטה בסיסי כמו כותרות ותאריכים.

  • 5,040הורדות בחודש
  • 70לייקים

מה זה

המאגר מכיל 708,241 רשומות של כתבות חדשותיות באנגלית, שפורסמו במקור בין ינואר 2017 לדצמבר 2019. כל רשומה כוללת את גוף הכתבה בטקסט גולמי, כותרת, תיאור קצר, תאריך פרסום, כתובת האתר המקורי, הדומיין וקישור לתמונה. הנתונים נלקחו מתוך המאגר הציבורי של Common Crawl באמצעות כלי החילוץ news-please, שמגרד אתרי חדשות ומחלץ מהם את המידע הנקי.

כדי לוודא שהכתבות אכן באנגלית, המפרסם סינן את הטקסטים באמצעות ספריית הזיהוי של Spacy והשאיר רק פריטים שקיבלו הסתברות של 80% ומעלה. אין במאגר חלוקה מובנית לסט בדיקה או ולידציה, אלא רק סט אימון יחיד. חשוב לשים לב שלא כל השדות מלאים בכל הרשומות, למשל שדה התיאור קיים רק ב־527,595 כתבות מתוך הסך הכולל.

מתאים ל

  • אימון מודלי שפה

    אימון מודלים להשלמת טקסט או מסכות על גבי כתבות עיתונאיות באנגלית.

  • יצירת כותרות לכתבות

    אימון מודלים שמקבלים את גוף הידיעה מייצרים כותרת מתאימה.

  • ניתוח תוכן לפי דומיין

    בדיקת סגנון כתיבה ואוצר מילים של אתרי חדשות שונים בעולם.

איפה זה נופל

הטקסט כולו באנגלית בלבד, כך שהוא לא יעזור ישירות לעבודה בעברית. הנתונים מוגבלים לשנים 2017 עד 2019, מה שאומר שהמידע בתוכם כבר אינו מעודכן ומודל שיתבסס עליהם לא יכיר אירועים מאוחרים יותר. בנוסף, מדובר בכתבות חדשות שמזכירות אנשים אמיתיים ודמויות ציבוריות מאותה תקופה. כרטיס המאגר לא מפרט אילו הטיות קיימות בתוכן, וקישורי התמונות לא עברו אימות ידני, כך שחלקם עלול להיות שבור.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר סונן במיוחד כדי לכלול כתבות באנגלית בלבד, ברמת ודאות של 80% ומעלה לפי כלי זיהוי שפה. אם אתם מחפשים תוכן עיתונאי מקומי, תצטרכו לפנות למקורות אחרים.

האם מותר להשתמש בו לפרויקט מסחרי?

הרישיון בדף המאגר מוגדר כלא ידוע, ואין אישור שימוש מפורש. הכתבות נאספו מאתרי אינטרנט ברחבי העולם, ולכן שימוש כזה כרוך בסיכון משפטי לא מבוטל.

איך מחולק הדאטהסט?

הוא מגיע כחלק אימון יחיד שמפוצל לחמישה קובצי parquet. אם אתם צריכים סטים להערכה ולבדיקה, תצטרכו לפצל את הנתונים בעצמכם בקוד.

האם כל השדות מלאים בכל הרשומות?

לא. בעוד שהטקסט, הכותרת והדומיין קיימים, שדה התיאור מופיע רק ב־527,595 כתבות מתוך 708,241, וקישורי התמונות לא אומתו.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face בפקודה אחת שמציינת את החלק train, שכן אין חלוקות אחרות. המאגר יושב בחמישה קובצי parquet, פתוח לכולם ולא דורש הרשמה מיוחדת או אישור גישה מראש. השדות המרכזיים לעבודה הם text עבור הטקסט המלא ו־title עבור הכותרת, כשבמקרה של שימוש בשדות המשניים כדאי להכניס בדיקת תקינות בקוד בגלל ערכים חסרים בתיאור ובקישורי התמונות.

from datasets import load_dataset

ds = load_dataset("vblagoje/cc_news")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות היא שאין הרשאה מפורשת להשתמש בטקסטים לצרכים מסחריים, לא ברורות חובות הייחוס, ואי אפשר לדעת בוודאות אם מותר להפיץ מודל שאומן עליהם. מי שבונה מוצר מסחרי לוקח כאן סיכון משפטי, ומוטב לבדוק את תנאי השימוש המקוריים של Common Crawl ואת זכויות היוצרים של אתרי החדשות.

הרישיון המלא ב־Hugging Face ↗