GPT
I

infini-news-corpus

קוד פתוח

ruggseacc-by-4.02026-01-29

  • news
  • journalism
  • media
  • common-crawl
  • cc-news

מאגר חדשות ענק שמחלץ טקסט נקי מקובצי CC-News בין 2016 ל־2026. הוא מתאים למי שבונה מודלי שפה או מערכות אחזור וצריך תוכן עיתונאי רב-לשוני מסודר עם מטא-דאטה.

  • 41,129הורדות בחודש
  • 35לייקים

מה זה

המאגר מכיל מעל 1.35 מיליארד רשומות של כתבות חדשותיות שנאספו מ־133,565 שמות מתחם שונים. המקור הוא סריקות ה־WARC של Common Crawl בפרויקט CC-News. הטקסט עצמו חולץ מתוך ה־HTML באמצעות trafilatura, שמשאירה את גוף הכתבה ללא תפריטים ושאריות עיצוב. כל שורה מייצגת כתבה אחת ומכילה סכמה שטוחה הכוללת את גוף הטקסט, מזהה מקור ה־WARC, תאריך פרסום, נושא, גיבובי בייטים ושיוך שפתי.

הקולקציה מסודרת בחלוקה חודשית ושנתית החל מאוגוסט 2016 ועד אפריל 2026. נפח הכתבות השנתי צומח מ־7.4 מיליון כתבות בחודשי 2016 הראשונים, מגיע לשיא של כ־201.9 מיליון כתבות בשנת 2022, ויורד בהדרגה בשנים שלאחר מכן. זיהוי השפות ברשומות מתבסס על שני מודלים עצמאיים, GlotLID שזיהה מעל אלף שפות ו־CommonLingua שזיהה 331 שפות.

מתאים ל

  • אימון מקדים למודלי שפה

    הזנת מעל טריליון טוקנים של תוכן עיתונאי רב-לשוני ללמידת מבנה שפה ועובדות עולם.

  • אחזור מידע ומנועי חיפוש

    בנייה והערכה של מערכות חיפוש טקסטואלי או RAG על בסיס ארכיון כתבות מקיף ועקבי.

  • סיווג נושאים ושפות

    אימון מסווגי טקסט אוטומטיים באמצעות המטא-דאטה המוכן של שפות ותגיות נושא.

איפה זה נופל

החילוץ מבוסס על סריקת הרשת של Common Crawl, כך שהוא סובל מההטיות הקבועות של איסוף רשת: ייצוג יתר לשפות נפוצות, אתרי ספאם וחוות תוכן שהתחפשו לאתרי חדשות. איכות הטקסט תלויה ביכולת של trafilatura להפריד תוכן אמיתי מרעשי עמוד, וזה לא תמיד מושלם. בנוסף, חלוקת השנים אינה אחידה. 2016 מכסה רק חמישה חודשים ו־2026 נעצרת באפריל, כך שמי שבונה מחקר על ציר זמן צריך לנרמל את הכמויות. אין כאן סינון איכות ידני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא ללא הגבלת מכירה. התנאי היחיד הוא מתן קרדיט מתאים ליוצרי המאגר.

כמה שטח אחסון צריך כדי לעבוד איתו מקומית?

הקבצים המכווצים דורשים כ־1.7 טרה-בייט בדיסק. אם פורסים את כל הנתונים לעבודה כטקסט פתוח, תצטרכו לפחות 3.4 טרה-בייט פנויים.

האם יש במאגר טקסטים בעברית?

הנתונים כוללים מאות שפות שזוהו אוטומטית דרך GlotLID ו־CommonLingua. רשימת שפות המקור המרכזיות כוללת שפות נפוצות כמו אנגלית, ספרדית, ערבית וגרמנית, אך עברית אינה מופיעה ברשימת השפות המובילות שנבדקו.

חייבים להוריד את כל הנפח הזה כדי לבדוק אותו?

לא. החומר מחולק לעשרות אלפי קובצי parquet לפי שנים וחודשים, כך שאפשר להוריד רק חודש בודד. בנוסף יש API ציבורי וממשק אינטרנטי שמאפשרים לבצע חיפושים בטקסט המלא בלי להוריד שום דבר.

איך טוענים

המאגר שוקל כ־1.7 טרה-בייט מכווץ בפורמט zstd parquet, ונפרס על פני 48,978 קבצים. אם תפרסו את הטקסט המלא ללא דחיסה תגיעו לכ־3.4 טרה-בייט, שהם כ־1.19 טריליון טוקנים. הגישה פתוחה ואינה דורשת אישור, אבל בגלל המשקל כדאי לגשת רק לחלקים הרלוונטיים באמצעות חלוקת התיקיות לפי שנה וחודש. לחלופין, אפשר לתשאל אותו ישירות ברשת בלי להוריד קובץ אחד דרך ממשק חיפוש ו־REST API ציבורי שהועמד בחינם.

from datasets import load_dataset

ds = load_dataset("ruggsea/infini-news-corpus")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי מלא, כולל אימון מודלים, יצירת נגזרות והפצה מחדש, כל עוד אתם נותנים קרדיט הולם למפרסמי המאגר ומציינים אם נעשו שינויים. אין דרישה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗