GPT
M

MINT-1T-PDF-CC-2024-18

קוד פתוח

mlfoundationscc-by-4.02024-07-15

  • multimodal

המאגר מרכז מסמכי PDF שחולצו מסריקת רשת בודדת של Common Crawl, כחלק מפרויקט רחב לאימון מודלים מולטימודליים. תרצו אותו אם אתם מאמנים מודל שמחבר בין תמונות לטקסט מתוך מסמכים אמיתיים.

  • 8,718הורדות בחודש
  • 31לייקים

מה זה

המאגר מכיל קובצי PDF שחולצו מקובצי WAT מתוך דאמפ CC-2024-18 של Common Crawl. כל רשומה כוללת טקסט שחולץ באמצעות PyMuPDF עם ניסיון לסדר קריאה לפי טורים משמאל לימין ומלמעלה למטה, יחד עם תמונות משובצות שחולצו מתוך המסמך. הוא מהווה תת-קבוצה ייעודית מתוך פרויקט MINT-1T הכולל בסך הכל מעל מיליארד מסמכים שמחולקים ל־HTML, מאמרי ArXiv ו־PDF.

הסינון הראשוני הגביל את הקבצים לגודל מרבי של 50 מגה-בייט ועד 50 עמודים. החוקרים השתמשו ב־fasttext כדי להשאיר רק תוכן באנגלית, והריצו מסנני איכות טקסט, הסרת כפילויות בפסקאות ובמסמכים באמצעות מסנני בלום, ומיסוך כתובות מייל ו־IP. תמונות מתחת ל־150 פיקסלים או מעל 20,000 פיקסלים הוסרו, יחד עם סינון תמונות לא ראויות וקביעת יחס תמונה מרבי של 3:1 כדי לשמור על תרשימים מדעיים.

מתאים ל

  • אימון מקדים מולטימודלי

    אימון מודלים להבנת רצפים משולבים של טקסט ותמונות מתוך דפי PDF.

  • חילוץ מידע מדוחות

    כוונון מודלים להבנת גרפים, תרשימים וטקסט שמופיעים יחד במסמכים טכניים.

  • מחקר על סדר קריאה

    בדיקת יכולת המודל להתמודד עם פריסות עמוד מורכבות וטקסט רב-טורי.

איפה זה נופל

הטקסט מוגבל לאנגלית בלבד, ואין כאן נתונים בעברית. מאחר שמקור הנתונים הוא סריקת רשת פומבית, הוא סובל מהטיות אינטרנט טיפוסיות, וסינון אוטומטי אינו מבטיח היעדר מוחלט של תוכן פוגעני. בנוסף, חילוץ סדר הקריאה באמצעות אלגוריתם טורים פשוט נוטה להישבר במסמכים בעלי עימוד מורכב, מה שמייצר טקסט מבולבל ברצף המולטימודלי. כרטיס המאגר פוסל במפורש שימוש צבאי או אימון מערכות שמזהות ומייצרות פרטי זיהוי אישיים ופנים.

שאלות
נפוצות

האם יש במאגר הזה טקסט בעברית?

לא. תהליך הסינון השתמש במודל fasttext כדי לסנן ולהשאיר תוכן באנגלית בלבד. אם המודל שלכם מיועד לעברית, המאגר הזה לא יספק לכם נתונים מתאימים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוצהר הוא CC-BY-4.0, שמאפשר שימוש מסחרי בכפוף לייחוס מתאים. עם זאת, החוקרים מגדירים אותו כמיועד בעיקר למחקר ומזהירים שהאחריות החוקית על שימוש מסחרי בתוכן שמקורו בסריקת אינטרנט חלה כולה על המפתח.

איך בנוי המאגר מבחינת קבצים?

המאגר מורכב מ־88,247 קובצי tar המחולקים למקטעים. כל מקטע מכיל את קובצי ה־PDF, התמונות שחולצו מהם והטקסט המסודר ברצף שנועד לאימון מודלים מולטימודליים.

במה הוא שונה מדאטהסטים אחרים של Common Crawl?

בניגוד למאגרי טקסט רגילים מ־WARC, כאן הופק מידע מקובצי WAT תוך התמקדות בלעדית ב־PDF. הדגש הוא על שמירת הרצף שבין תמונות, תרשימים והטקסט שסביבם, במקום טקסט רציף בלבד.

איך טוענים

הנתונים מחולקים ל־88,247 קובצי tar פתוחים לחלוטין להורדה ללא צורך בבקשת גישה מיוחדת. הפריסה נעשית באמצעות קריאה ישירה של ארכיוני ה־tar, כאשר יש לקחת בחשבון שמדובר בחלק ממאגר של מיליארדי טוקנים ומאות אלפי קבצים שמצריכים אחסון מקומי רחב ותהליך עיבוד מקבילי יעיל. שימו לב לעדכוני היוצרים, כמאה אלף מסמכים הוסרו בעדכון מאוחר עקב אי-התאמה בין פריימים בתמונות TIFF למטא-דאטה, וגיבובי התמונות במטא-דאטה סומנו כלא מדויקים אף שהתמונות עצמן תקינות.

from datasets import load_dataset

ds = load_dataset("mlfoundations/MINT-1T-PDF-CC-2024-18")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון דורש מתן קרדיט וייחוס למחברים, ואינו מחייב שיתוף באותו רישיון. היוצרים מציינים שהמאגר נועד בעיקר למחקר, ומדגישים שעל המשתמשים לוודא בעצמם עמידה בחוקי זכויות יוצרים מקומיים לפני שימוש מסחרי בתוכן שנסרק מהרשת.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗