GPT
P

PIN-200M

קוד פתוח

m-a-papache-2.02024-05-25

  • multimodal
  • interleaved

מאגר ענק של מסמכים משולבי טקסט ותמונות שנועד לאימון מודלים מולטימודליים. מקבלים כאן ייצוג כפול של כל עמוד: טקסט מרקדאון עם תמונות מוטמעות, לצד תמונה כוללת של המסמך המלא.

  • 150,080הורדות בחודש
  • 24לייקים

מה זה

המאגר מאחד תשעה מקורות שונים לכמעט מאתיים מיליון רשומות. החלק הארי מגיע ממאגרי רשת קיימים כמו OBELICS, שאחראי ליותר מ־176 מיליון מסמכים, ו־MMC4. לצידם תמצאו מקורות ממוקדים יותר כמו מאמרים רפואיים מ־PIN-PMC, קוד ותרגילים מ־LeetCode, מאמרי לינוקס, ספרים מ־PG19 ומסמכים מובנים מ־DocLayNet.

כל רשומה בנויה מקובץ JSONL הכולל את הטקסט בפורמט מרקדאון, רשימת הפניות לתמונות תוכן שמופיעות בגוף הטקסט, ונתיב לתמונת תצוגה כוללת של העמוד. בנוסף, החוקרים צירפו מדדי איכות מחושבים לכל דגימה, כמו ספירת טוקנים לפי Llama-3.2-1B, כמות החלפות בין טקסט לתמונה, ומספר תגיות עיצוב. חשוב לשים לב שתת המאגר PIN-Arxiv לא שוחרר בגרסת התצוגה המקדימה.

מתאים ל

  • אימון מודלי ראייה-שפה

    לימוד הבנה של מסמכים מורכבים שבהם טקסט ותמונות שזורים זה בזה ברצף.

  • חילוץ מידע ממסמכים ו־OCR

    אימון מודלים להבנת מבנה של עמודים שלמים באמצעות תמונת ה־overall וטקסט המרקדאון.

  • סינון מקדים של דאטה

    שימוש במדדי ה־quality_signals כדי לבנות תתי מאגרים נקיים לפי יחס טקסט-תמונה.

איפה זה נופל

המאגר כולל אנגלית וסינית בלבד, אין בו עברית כלל. מעבר לזה, המפרסמים מודים במפורש בחלקים פגומים או חסרים, ספציפית במקטעים מסוימים בתוך OBELICS, PIN-PMC ו־PIN-Arxiv. יש גם בעיות לא פתורות במדדי האיכות של תת המאגר chinese-markdown. אם אתם בונים על ייצוג מסמכים אקדמיים, זכרו שתת המאגר של Arxiv חסר בגרסה הזו.

אותה משפחה

PIN יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר מוגדר כ־Apache 2.0, אבל בפועל מדובר באוסף ממקורות שונים. כל דגימה מכילה שדה רישיון משלה, וחלקן מוגדרות תחת CC-BY-NC שאוסר שימוש מסחרי. תצטרכו להריץ סקריפט סינון על שדה הרישיון ב־JSONL כדי להשאיר רק דגימות מותרות.

כמה מקום אחסון צריך בשביל להוריד אותו?

המאגר המלא דורש כ־312 טרה-בייט. אם אתם מוותרים על קובצי התמונות ורוצים לעבוד רק על הטקסט ומדדי האיכות, קובצי ה־JSONL שוקלים כ־800 ג'יגה-בייט.

האם יש במאגר נתונים בעברית?

לא. המאגר מתמקד בשתי שפות בלבד, אנגלית וסינית, ואין בו ייצוג לשפות אחרות.

מה המשמעות של השדות content_image לעומת overall_image?

קובצי content_image הם התמונות הבודדות המוטמעות בתוך הטקסט, למשל תרשימים או איורים במאמר. לעומת זאת, overall_image הוא צילום של העמוד או המסמך כולו, שנוצר ברינדור או הומר מקובץ PDF מקורי.

איך טוענים

לא צריך לבקש אישור גישה מיוחד, אבל צריך תשתית רצינית מאוד. כלל המאגר דורש כ־312 טרה-בייט של אחסון, עם למעלה מ־16,000 קבצים הכוללים ארכיוני tar מחולקים. אם תרצו רק את קובצי ה־JSONL בלי התמונות, תוכלו להוריד אותם ישירות באמצעות huggingface-cli עם סינון לקובצי jsonl בלבד, שזה נפח של כ־800 ג'יגה-בייט. הרשומות כוללות שדות מפתח כמו id, הטקסט תחת md, נתיבים לקובצי התמונות ומטא-דאטה עשיר תחת meta ו־quality_signals שמאפשר לסנן דגימות בלי לפתוח את כל התמונות.

from datasets import load_dataset

ds = load_dataset("m-a-p/PIN-200M")

הרישיון

המאגר מוגדר ברישיון Apache 2.0 ברמת העל שלו, אבל אל תתנו לזה להטעות אתכם. כל רשומה ב־JSONL מכילה שדה license משלה, שמייצג את מקור הדאטה המקורי. יש שם תכנים תחת MIT ו־CC-BY-4.0, אבל גם רשומות ברישיון CC-BY-NC-4.0 שאוסר שימוש מסחרי, כמו בדוגמה מ־linux-cn. אם המטרה שלכם היא לאמן מודל לשימוש מסחרי, תהיו חייבים לסנן את הרשומות לפי הרישיון הפנימי שלהן לפני תחילת האימון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗