GPT
A

arxiv-metadata-snapshot

קוד פתוח

librarian-botscc0-1.02023-10-08

  • arxiv
  • science

המאגר כולל מיליוני רשומות מטא-דאטה של מאמרים מדעיים מ־arXiv. הוא מתאים למי שרוצה לאמן מודלים על כותרות, תקצירים וקטגוריות מדעיות בלי להוריד קובצי PDF שלמים.

  • 4,136הורדות בחודש
  • 22לייקים

מה זה

מדובר במראה ישירה של חלק המטא-דאטה מתוך הדאטהסט של arXiv שמפורסם במקור בקגל. המאגר מכיל בין מיליון לעשרה מיליון רשומות, וכולל עשרה קובצי פארקט שמרכיבים חלוקה אחת של נתוני אימון. הכרטיס לא מדווח על סינון מיוחד שנעשה מעבר לסנכרון שבועי מהמקור בקגל.

כל רשומה מייצגת מאמר מדעי יחיד. המידע בכל שורה מורכב משדות ברורים שכוללים את מזהה המאמר, שם המגיש, שמות הכותבים, כותרת, הערות כמו מספרי עמודים, הפניה לכתב עת, מזהה דיגיטלי, תקציר המאמר, קטגוריות ותגיות לפי המערכת של האתר, והיסטוריית גרסאות של הפרסום.

מתאים ל

  • סיווג נושאי של מאמרים

    אימון מודלים לסיווג אוטומטי של תקצירים לקטגוריות מדעיות לפי התגיות הקיימות.

  • יצירת תקצירים וכותרות

    אימון מודלי שפה על כותרות ותקצירים לטובת משימות ניסוח וסיכום טקסט מדעי.

  • ניתוח מגמות מחקר

    מעקב אחרי תחומי פרסום ושיתופי פעולה בין חוקרים לאורך ציר הזמן והגרסאות.

איפה זה נופל

הנתונים מכילים אנגלית בלבד, כך שאין כאן שום ייצוג לעברית או לשפות אחרות. הכרטיס לא מציין סינון איכות, ניקוי רעשים או בדיקות כפילויות, ולכן תמצאו שם מטא-דאטה גולמי בדיוק כפי שהוגש על ידי החוקרים. הנתונים מתעדכנים על בסיס שבועי ולכן עלולים לפגר אחרי פרסומים חדשים מהימים האחרונים. בנוסף, חסר כאן גוף המאמר המלא, ומי שבונה על טקסט ארוך יצטרך לקצור את המסמכים בעצמו דרך הקישורים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, הרישיון הוא CC0 1.0 שמוותר על זכויות יוצרים ומעביר את המידע לנחלת הכלל. אפשר לאמן עליו מודלים מסחריים בלי לשלם תמלוגים ובלי חובת מתן קרדיט.

האם יש במאגר טקסטים בעברית?

לא, הדאטהסט מוגדר ומכיל טקסטים באנגלית בלבד. כל התקצירים והכותרות נלקחו מפרסומים מדעיים שהוגשו ל־arXiv בשפה זו.

האם הדאטהסט כולל את תוכן המאמרים המלא?

לא, המאגר כולל מטא-דאטה בלבד כמו כותרות, תקצירים, מחברים וקטגוריות. כדי להגיע לטקסט המלא, הכרטיס מספק תבנית קישור להורדת ה־PDF ישירות לפי שדה המזהה.

באיזה פורמט המידע שמור ואיך הוא מאורגן?

המידע מאורגן בסט יחיד של נתוני אימון שמפוצל לעשרה קובצי parquet. הפורמט הזה נוח לעבודה מקבילית וחסכוני בזיכרון בזמן הטעינה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets מ־Hugging Face ללא צורך באישור גישה מראש או מפתחות. הנתונים מחולקים לעשרה קובצי parquet שונים בתיקיית המידע, כך שאפשר לקרוא אותם במקביל או בחלקים. השדות הקריטיים לעבודה הם abstract לטקסט המרכזי, categories למשימות סיווג, ו־id אם תרצו למשוך את ה־PDF המלא ישירות מהשרתים החיצוניים של arXiv.

from datasets import load_dataset

ds = load_dataset("librarian-bots/arxiv-metadata-snapshot")

הרישיון

המאגר משוחרר תחת רישיון CC0 1.0 שמקביל לנחלת הכלל. מותר להשתמש בנתונים לכל מטרה, כולל פיתוח ואימון של מודלים מסחריים, ללא חובת ייחוס וללא דרישה לשתף את התוצרים באותו רישיון. אין על המידע הגבלות שימוש חוזר.

הרישיון המלא ב־Hugging Face ↗