GPT
A

arxiv_dataset

קוד פתוח

arxiv-communitycc0-1.02022-03-02

מאגר של 1.7 מיליון רשומות מטא-דאטה ממאמרים מדעיים. הוא מיועד למי שבונה מנועי חיפוש סמנטי, מערכות המלצה למחקר או מודלים לסיווג קטגוריות בלי להוריד טרה-בייטים של קובצי PDF.

  • 748הורדות בחודש
  • 137לייקים

מה זה

המאגר כולל מידע ביבליוגרפי על 1.7 מיליון מאמרים שהועלו לארכיוו, ומשמש מראה של המידע המקורי מ־Kaggle. במקום לשמור את הטקסט המלא של המאמרים שתופס מעל 1.1 טרה-בייט, יש כאן קובץ מטא-דאטה מבוסס JSON בלבד. כל רשומה כוללת את מזהה המאמר, הכותרת, התקציר, שמות המחברים, מי שהגיש את הקובץ, קטגוריות ותגיות המערכת, מזהה DOI, הפניות לכתבי עת והערות טכניות כמו מספר עמודים ואיורים.

המקור מבוסס ישירות על מאמרי ארכיוו מתחומי הפיזיקה, מדעי המחשב, מתמטיקה, סטטיסטיקה, הנדסת חשמל, ביולוגיה כמותית וכלכלה שנאספו במשך קרוב לשלושים שנה. המאגר אינו מחולק מראש לקבוצות אימון, בדיקה או ולידציה, ואין בו תיוגים ייעודיים חיצוניים מעבר למידע שהזינו החוקרים בעת ההגשה.

מתאים ל

  • סיווג קטגוריות מדעי

    אימון מודלים לחיזוי תחום המאמר לפי התקציר והכותרת באמצעות שדה הקטגוריות המובנה.

  • מנועי המלצה ומחקר

    בניית מערכות שמציעות מאמרים רלוונטיים לחוקרים על בסיס דמיון סמנטי ברמת התקצירים.

  • בניית גרפי ידע

    מיפוי קשרים בין חוקרים, נושאים והפניות לכתבי עת מתוך נתוני המחברים והמזהים.

איפה זה נופל

הטקסטים כולם באנגלית בלבד ואין במאגר ייצוג למאמרים בעברית. מעבר לכך, הכרטיס אינו כולל פרטים על ניקוי הנתונים, סינון כפילויות, בקרת איכות של המידע שהוזן ידנית על ידי החוקרים או טיפול במידע אישי. המאגר פורסם במרץ 2022 ומכיל 1.7 מיליון מאמרים, כך שמאמרים חדשים יותר אינם מופיעים בו. החיסרון המשמעותי ביותר הוא היעדר גוף המאמרים המלא, מה שמונע אימון מודלי שפה על תוכן המחקר עצמו ללא תהליך משיכה נפרד ומורכב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר משוחרר ברישיון CC0 לנחלת הכלל, מה שמאפשר שימוש מסחרי מלא ללא הגבלות, ללא צורך בתשלום תמלוגים וללא דרישת ייחוס.

האם יש במאגר תוכן בעברית?

לא. המאגר מוגדר ותומך בשפה האנגלית בלבד, ואינו כולל מאמרים או תקצירים בעברית.

האם המאגר כולל את הטקסט המלא של המאמרים?

לא. הטקסט המלא של מאמרי ארכיוו שוקל מעל 1.1 טרה-בייט, ולכן המאגר הזה מספק קובץ מטא-דאטה בלבד שמכיל שדות כמו כותרת, תקציר, מחברים וקטגוריות.

האם המידע מחולק לקבוצות אימון ובדיקה?

לא. הדאטהסט מגיע כמקשה אחת ללא חלוקה מובנית ל־train, test או validation, ותצטרכו לפצל את הנתונים בעצמכם לפי הצורך.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות הסקריפט arxiv_dataset.py שנמצא במאגר, ללא צורך באישור גישה מיוחד או בהרשמה מראש. הקבצים עצמם קלים משמעותית מהמאגר המקורי המלא, כי הם לא כוללים את קובצי ה־PDF אלא רק מטא-דאטה בפורמט JSON.

השדות המרכזיים לעבודה הם id כדי לגשת למאמר המקורי ברשת, abstract שמכיל את תקציר המחקר, categories לסיווג נושאי, ו־title. אם רוצים לחלץ את גוף המאמר המלא, תצטרכו להשתמש במזהה כדי למשוך את הקבצים עצמאית, כי הם לא חלק מהטעינה הזו.

from datasets import load_dataset

ds = load_dataset("arxiv-community/arxiv_dataset")

הרישיון

המאגר מפורסם תחת רישיון CC0 1.0 שמקצה אותו לנחלת הכלל. הרישיון מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי והפצה, ללא חובת מתן קרדיט וללא דרישה לשתף תוצרים ברישיון זהה. אפשר לאמן עליו מודלים מסחריים בלי לחשוש מהגבלות רישוי של המטא-דאטה.

הרישיון המלא ב־Hugging Face ↗