GPT
A

ArxivCap

קוד פתוח

MMInstructioncc-by-4.02023-12-01

  • arxiv
  • multi-modal

המאגר מרכז 6.4 מיליון תמונות ממאמרים מדעיים עם תיאורים וטקסט שחולץ מהן. הוא מתאים למי שמאמן מודלי ראייה שפה על גרפים, דיאגרמות ותוכן אקדמי מורכב.

  • 17,115הורדות בחודש
  • 58לייקים

מה זה

כל רשומה מייצגת מאמר אקדמי בודד מתוך 570 אלף מאמרים שפורסמו עד יוני 2023. הרשומה מכילה את כותרת המאמר, התקציר, מזהה המקור ונתוני מטא עשירים כמו קטגוריות, כתב עת ומספר ציטוטים שנלקחו מקגל ומסמנטיק סקולר.

החלק המרכזי הוא שדה התמונות והכיתובים, שכולל בסך הכל 3.9 מיליון כיתובים ו־193 מיליון מילים. כל תמונה נשמרת כאובייקט עצמאי יחד עם כיתוב ראשי, תת כיתוב, שם קובץ ותוצאות טקסט שחולצו ממנה באמצעות PaddleOCR. כרטיס המאגר לא מפרט את תהליך הסינון עצמו ומפנה למאמר המדעי לקבלת הפרטים הללו.

מתאים ל

  • אימון מודלי ראייה שפה

    לימוד הבנה של גרפים, דיאגרמות מדעיות וכיתובים מורכבים ברמת דיוק אקדמית.

  • פענוח טקסט מתרשימים

    שימוש בזוגות התמונה והטקסט כדי ללמד מודלים לקרוא נתונים מתוך איורים טכניים.

  • שיוך כיתובים לתמונות

    התאמת תיאורים מילוליים והקשר מדעי לאיורים ותרשימים מתוך מאמרים.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן ייצוג לשפות אחרות. כל החומר נאסף ממאמרים שפורסמו עד יוני 2023, כך שהתחומים שהתפתחו מאז אינם מעודכנים כאן. הכרטיס לא מפרט את שיקולי הסינון, איכות חילוץ הטקסט או הטיות תחום, ומפנה למאמר החיצוני. בנוסף, חילוץ הטקסט נעשה באמצעות PaddleOCR בלבד ויכול להכיל שגיאות זיהוי שמצריכות בדיקה ידנית לפני שרצים לאימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ להסתכן. אמנם ראש העמוד מציין רישיון cc-by-4.0 שמתיר מסחר, אך גוף הכרטיס מגדיר בפירוש רישיון CC BY-NC-SA 4.0. ההגדרה הזו אוסרת שימוש מסחרי ומחייבת שיתוף באותם תנאים.

האם יש במאגר נתונים בעברית?

אין עברית כלל. המאגר מבוסס על מאמרים מדעיים ומסווג תחת השפה האנגלית בלבד, כולל התקצירים, הכיתובים והטקסט שחולץ מהתמונות.

איך המידע חולץ ומאיפה הוא הגיע?

הנתונים נאספו מ־570 אלף מאמרי arXiv שפורסמו עד יוני 2023. פרטי המאמרים הוצלבו עם מאגרי Kaggle ו־Semantic Scholar, והטקסט מהתמונות חולץ בעזרת כלי ה־OCR של PaddleOCR.

כמה קבצים צריך להוריד כדי להתחיל לעבוד?

המאגר כולל 6,549 קובצי parquet. אין חובה להוריד את כל המאגר יחד, ואפשר לטעון קבצים בודדים ישירות בקוד כדי להתנסות או לבצע בדיקות מקדימות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets או מורידים את הקבצים בעזרת git lfs. המאגר מפוצל ל־6,549 קובצי parquet, מה שאומר שלא צריך למשוך הכל בבת אחת ואפשר לקרוא קבצים בודדים לפי הצורך. הגישה פתוחה ואינה דורשת אישור מיוחד. השדות המרכזיים לעבודה הם caption images שמכיל את התמונות עצמן, והמטא דאטה שמחזיק את הטקסטים והציטוטים.

from datasets import load_dataset

ds = load_dataset("MMInstruction/ArxivCap")

הרישיון

יש פה סתירה שחייבים לשים לב אליה. בעמוד המאגר מדווח רישיון cc-by-4.0, אבל הטקסט של כרטיס המידע קובע שהשחרור נעשה תחת רישיון CC BY-NC-SA 4.0. המשמעות של התנאי האחרון היא איסור מוחלט על שימוש מסחרי וחובת שיתוף זהה של כל תוצר נגזר. אם אתם בונים מודל למוצר מסחרי, המאגר הזה בעייתי ומסוכן משפטית.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗