GPT
P

PIN-14M

קוד פתוח

m-a-papache-2.02024-04-12

  • multimodal
  • interleaved

14 מיליון מסמכי מרקדאון שמשלבים טקסט ותמונות, עם תמונת עמוד מלאה לכל מסמך. המאגר נבנה כדי לאמן מודלים מולטימודליים על מסמכים מורכבים במקום על תמונות מבודדות עם כיתוב קצר.

  • 4,068הורדות בחודש
  • 37לייקים

מה זה

המאגר מאחד תשעה תת מאגרים שונים לתוך מבנה אחיד. בפנים תמצאו דאטהסטים מוכרים כמו OBELICS, MMC4, PG19 ו־DocLayNet, לצד מקורות ייעודיים למאמרים מדעיים מ־arXiv ו־PMC, בעיות מ־LeetCode ותוכן טכני מסין. כל רשומה מייצגת מסמך או עמוד בפורמט מרקדאון, ומכילה שתי רמות של ויזואליה: תמונות תוכן שמופיעות בגוף הטקסט, ותמונת תצוגה כוללת שמציגה את המסמך כולו כפי שהוא נראה בעין.

הצוות עיבד את הנתונים וחילץ עבור כל רשומה מדדי איכות מובנים. המדדים כוללים את רמת השזירה בין הטקסט לתמונות, מספר בלוקי הטקסט, אורך התווים וכמות הטוקנים לפי טוקנייזר של Llama 3.2 1B. המטרה של המבנה הזה היא לאפשר סינון מהיר של מסמכים לפי עומק ואיכות, בלי שתצטרכו לקרוא ולנתח מיליוני קובצי מרקדאון ותמונות בעצמכם.

מתאים ל

  • אימון מודלי ראייה-שפה

    אימון מודלים מולטימודליים על טקסט ששוזר תמונות דיאגרמות ותרשימים.

  • הבנת מסמכים ודוחות

    לימוד מודלים להבין מבנה חזותי של עמוד שלם לצד הטקסט המחולץ שבו.

  • סינון דאטה למודלים

    שימוש במדדי האיכות המוכנים כדי לדגום רק מסמכים טכניים צפופים ועשירים.

איפה זה נופל

הנתונים קיימים רק באנגלית ובסינית, כך שאימון למסמכים בעברית לא יקבל כאן מענה ישיר. מעבר לזה, קיימות בעיות לא פתורות בחלק מהתת מאגרים, בפרט סביב סיגנלי האיכות בתת המאגר הסיני, שהמפרסמים הודו שהם עדיין מתקנים. המקורות נאספו בין אפריל למאי 2024, כך שיש תלות באיכות המקורית של מאגרי הרשת שממנו הם נלקחו, כולל שגיאות עיבוד מובנות של מסמכים וסריקות.

אותה משפחה

PIN יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר עצמו מוגדר תחת רישיון Apache-2.0, אך הדגימות בתוכו שומרות על רישיונות המקור שלהן. חלק מהרשומות מוגדרות תחת רישיון CC-BY-NC-4.0 שאוסר שימוש מסחרי לחלוטין. אם המטרה היא אימון מודל מסחרי, תצטרכו להריץ סקריפט שמסנן החוצה כל רשומה שאינה ברישיון מתאים כמו MIT או Apache.

כמה מקום בדיסק צריך בשביל להוריד הכל?

הורדה מלאה של כל הקבצים, כולל כל התמונות הדחוסות, דורשת סדר גודל של כ־18.79 טרה בייט. מתוכם, קובצי ה־JSONL שמכילים את הטקסט והמטא-דאטה תופסים כ־70 ג'יגה בייט בלבד. רוב הנפח מוקדש לתמונות התוכן ולתמונות התצוגה של המסמכים המלאים.

האם יש בדאטהסט תמיכה בעברית?

לא. הדאטהסט כולל אך ורק מסמכים באנגלית ובסינית, כפי שמוגדר במטא-דאטה ובטקסטים של תת-המאגרים. אין בו טקסטים בעברית ולכן הוא לא מתאים לאימון ישיר של יכולות שפה מקומיות.

מאיפה הגיעו הנתונים שנמצאים במאגר?

הנתונים אוגדו מתשעה מקורות חיצוניים שונים שעברו המרה לפורמט מרקדאון ותמונות אחיד. המקורות כוללים מאגרי רשת קיימים כמו OBELICS ו־MMC4, מאמרים מ־PubMed Central ומ־arXiv, שאלות תכנות מ־LeetCode, ספרים מ־PG19, מסמכים מ־DocLayNet ותוכן טכני מ־Linux-CN.

איך טוענים

אתם מושכים את הקבצים דרך huggingface-cli, אבל מדובר במפלצת אחסון של כמעט 19 טרה בייט. הקבצים מחולקים לחלקים מכווצים של תמונות תוכן, תמונות מלאות וקובצי JSONL שמחזיקים את המטא דאטה. אם אתם צריכים רק את הטקסט והמדדים, אפשר ומומלץ להוריד רק את קובצי ה־JSONL ולחסוך את רוב הנפח. שימו לב שהחלק של PIN-Arxiv לא שוחרר בגרסת התצוגה המקדימה.

from datasets import load_dataset

ds = load_dataset("m-a-p/PIN-14M")

הרישיון

המאגר מדווח תחת רישיון Apache-2.0 ברמת העל, שמאפשר שימוש מסחרי, שינוי והפצה בלי לחייב פתיחת קוד של המודל שלכם. המלכוד האמיתי מסתתר בתוך הרשומות עצמן: שדה הרישיון בכל דגימה מציג רישיונות שונים של חומרי המקור, כולל CC-BY-NC-4.0 שאוסר שימוש מסחרי, או MIT ו־CC-BY-4.0 שמחייבים מתן קרדיט. אם אתם בונים מודל מסחרי, תהיו חייבים לסנן את הדאטה לפי שדה הרישיון הפנימי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗