GPT
A

AICC

קוד פתוח

opendatalabcc-by-4.02025-10-15

  • common-crawl
  • html-parsing
  • markdown
  • code
  • math

חילוץ מבוסס מודל של עמודי Common Crawl לפורמט מרקדאון נקי. המטרה היא להביא טקסט רשת לאימון מודלי שפה בלי לאבד נוסחאות, טבלאות ובלוקים של קוד.

  • 24,168הורדות בחודש
  • 115לייקים

מה זה

המאגר מבוסס על סריקות הרשת של Common Crawl מהדאמפים CC-MAIN-2025-08 שכולל 2,391,293,976 רשומות מחולצות, ו־CC-MAIN-2025-13 שכולל 2,452,518,662 רשומות מחולצות. המפתחים השתמשו במנוע חילוץ בשם MinerU-HTML, שמנתח את הסמנטיקה של מבנה ה־HTML במקום להסתמך על חוקים היוריסטיים פשוטים. התוצאה כוללת רק את הדפים שחולצו בהצלחה, מתוך סך של יותר מחמישה מיליארד דפי מקור.

כל רשומה מגיעה במבנה שמכיל את תוכן העמוד כטקסט מרקדאון, לצד זיהוי שפה שנעשה באמצעות fastText lid.176.bin, כתובת ה־URL המקורית, מזהה מעקב ייחודי, שיטת החילוץ ונתיב הקובץ המקורי ברשת. בנוסף לחומר הכללי, המאגר מציע פיצולים ממוקדים שכוללים את CC-MinerU-Code עם 4.58M דוגמאות קוד, ואת CC-MinerU-Formula שמכיל 975,155 דוגמאות של נוסחאות מתחומי המתמטיקה, הפיזיקה, הכימיה וההנדסה.

מתאים ל

  • קדם אימון למודלי שפה

    אימון מודלים על מיליארדי דפי רשת ששומרים על תחביר קוד, טבלאות ונוסחאות מתמטיות.

  • אימון על קוד מקור

    שימוש בתת המאגר הייעודי של מיליוני קטעי קוד מובנים במרקדאון להבנת תכנות.

  • שיפור יכולות חשיבה מדעית

    שילוב דאטהסט הנוסחאות הרב תחומי באימון מודלים למשימות מתמטיקה ומדעים מדויקים.

איפה זה נופל

מכיוון שהתוכן מגיע היישר מסריקות רשת של Common Crawl, הכרטיס מזהיר במפורש שהוא כולל תוכן רגיש או מוטה, והאחריות לבדיקה שלו חלה על המשתמש. שפות האתרים מוגדרות רב לשוניות לפי זיהוי אוטומטי של מודל fastText, כך שאין כאן התחייבות לאיזון בין שפות או לאיכות הטקסט בשפות שאינן אנגלית. בנוסף, המאגר מספק אך ורק דפים שעברו בהצלחה את מנוע החילוץ של MinerU-HTML, ללא הדפים שנכשלו בעיבוד או מידע על סוגי הכשלים שנוצרו בדרך.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי, מחקרי והתאמה של הנתונים לכל מטרה. התנאי המרכזי הוא מתן קרדיט ברור למפרסמים המקוריים לפי ההנחיות. יחד עם זאת, האחריות המשפטית על התכנים שנאספו מהרשת נשארת אצל מי שמאמן את המודל.

האם הדאטהסט כולל טקסט בעברית?

המאגר מוגדר רב לשוני והשפות סווגו בעזרת המודל lid.176.bin של fastText, שתומך גם בעברית. עם זאת, הכרטיס אינו מפרט את אחוז הדפים בעברית מתוך סך הנתונים. מי שבונה מודל לעברית יצטרך לפלטר את הקבצים לפי שדה השפה כדי לבדוק את הנפח בפועל.

מה ההבדל בין המאגר הזה לחילוץ רגיל של Common Crawl?

חילוצים פשוטים נוטים לאבד את מבנה הדף ולהפוך טבלאות, נוסחאות וקוד לבליל טקסט לא קריא. כאן המפתחים הפעילו את MinerU-HTML, שמנתח את הסמנטיקה של תגיות ה־HTML ומייצא מרקדאון נקי. זה שומר על בלוקים מובנים של מידע בדיוק כפי שהם הופיעו ברשת.

כמה קבצים כולל המאגר ואיך מתמודדים עם הגודל שלו?

המאגר מורכב מ־10,056 קבצים בתצורת snappy.parquet, שכוללים מיליארדי שורות טקסט משני דאמפים שונים של שנת 2025. אי אפשר לטעון אותו לזיכרון של מחשב רגיל, ותצטרכו לעבוד עם כלי עיבוד מבוזרים כמו Spark או מנגנוני הזרמת נתונים כדי לקרוא את המידע ישירות.

איך טוענים

הנתונים מחולקים ליותר מעשרת אלפים קבצי snappy.parquet, כך שאין צורך באישור גישה כדי להוריד אותם, אבל נדרשת תשתית מתאימה להתמודדות עם כמויות עצומות של מידע מבוזר. שדה המפתח לעבודה שוטפת הוא content, שמחזיק את הטקסט המפורמט במרקדאון. למי שרוצה לסנן לפי שפה ספציפית, כדאי להישען כבר בשלב הקריאה הראשוני על השדה language, וכדי לחקור את מקור הנתונים או לוודא עובדות אפשר להצליב את url ו־sub_path ישירות מול קבצי המקור של Common Crawl.

from datasets import load_dataset

ds = load_dataset("opendatalab/AICC")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. אפשר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולאמן עליו מודלים, בתנאי שנותנים קרדיט מלא למפרסמים לפי הדרישות. הרישיון אינו דורש שיתוף של מודלים או תוצרים באותו רישיון, אך יש לקחת בחשבון שהתוכן עצמו נאסף מאתרי אינטרנט ציבוריים שונים, ומשתמשי הקצה אחראים לשימוש חוקי ואתי בחומר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗