GPT
M

ML-ArXiv-Papers

קוד פתוח

CShortenafl-3.02022-06-23

המאגר מרכז כותרות ותקצירים של כמאה אלף מאמרי למידת מכונה מתוך ArXiv. הוא מתאים למי שרוצה לאמן מודלי שפה על טקסט מדעי ממוקד בלי להוריד מיליוני מאמרים מתחומים אחרים.

  • 4,386הורדות בחודש
  • 71לייקים

מה זה

המאגר כולל רשומות טקסט של מאמרים אקדמיים שנמשכו מתוך המאגר המלא של ArXiv שיושב ב־Kaggle. מתוך כמעט שני מיליון מאמרים במאגר המקורי ההוא, נשלפו רק אלה שסומנו בתגית cs.LG, שמשמעותה למידת מכונה. הסינון הזה השאיר בערך 100,000 מאמרים בלבד.

בגרסה הנוכחית של הדאטהסט כל רשומה כוללת שני שדות בלבד, כותרת המאמר ותקציר המאמר. היוצר מציין שתחזוקת הנתונים נעשית מול ה־API של ArXiv, אך כרגע אין כאן את גוף המאמר המלא. שדות נוספים שנמצאים במקור, כמו שמות המחברים, תאריכי עדכון, קטגוריות נוספות, מזהה דיגיטלי והרישיון המקורי של המאמר עצמו, הושמטו ולא קיימים בקובץ הקיים.

מתאים ל

  • אימון מודלי תמצות

    יצירת כותרות מתאימות מתוך תקצירים של מאמרים בלמידת מכונה.

  • אימון מודלי שיבוץ (Embeddings)

    בניית מרחב וקטורי למציאת דמיון בין מחקרים לפי כותרת ותקציר.

  • סיווג נושאים בתוך תחום ה־ML

    חלוקה לתת-תחומים ונושאים מחקריים על בסיס הטקסט של התקציר.

איפה זה נופל

הטקסט כולו באנגלית אקדמית ואין כאן עברית בכלל. החיסרון המשמעותי ביותר הוא היעדר מטא-דאטה, אין לכם תאריכי פרסום כדי לפלטר לפי זמנים, ואין שמות מחברים או מזהי מאמר. בנוסף, חסר הטקסט המלא של המאמרים, כך שאי אפשר להשתמש בו לניתוח מעמיק של שיטות או תוצאות. קחו בחשבון שהמאגר פורסם ביוני 2022 וכל מאמר שיצא מאז פשוט לא נמצא כאן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

רישיון afl-3.0 מאפשר עקרונית שימוש מסחרי בכפוף לדרישות ייחוס. עם זאת, הדאטהסט כולל תקצירים מתוך ArXiv בלי פירוט הרישיון המקורי של כל מאמר, ולכן בשימוש מסחרי כדאי לוודא שאין התנגשות מול בעלי הזכויות המקוריים של המאמרים.

האם יש בדאטהסט תוכן בעברית?

לא. המאגר מורכב כולו ממאמרים אקדמיים שהוגשו ל־ArXiv תחת קטגוריית מדעי המחשב ולמידת מכונה, וכולם כתובים באנגלית בלבד.

איך הדאטהסט נאסף וממה הוא מורכב?

הוא נוצר מתוך סינון של מאגר ArXiv הכללי שקיים ב־Kaggle. מתוך כשני מיליון מאמרים נשלפו כמאה אלף מאמרים שתוייגו ב־cs.LG, ונשמרו רק שדות הכותרת והתקציר.

מה ההבדל בינו לבין המאגר המלא של ArXiv ב־Kaggle?

המאגר המלא שוקל הרבה יותר, מכיל שני מיליון מאמרים מכל תחומי המדע וכולל שדות כמו מחברים, גרסאות וציטוטים. המאגר הזה שוקל מעט מאוד, ממוקד רק בלמידת מכונה, אך הוסרו ממנו כל השדות למעט כותרת ותקציר.

איך טוענים

הנתונים מגיעים בקובץ CSV יחיד בשם ML-Arxiv-Papers.csv, לצד קובץ תיעוד. אין צורך באישור גישה מיוחד כדי להוריד אותו ישירות מהמאגר, וכל מה שתקבלו בפנים זה עמודות של כותרת ותקציר באנגלית. בגלל שמדובר בטקסט קצר יחסית בלי גוף המאמרים המלא, הטעינה לזיכרון ב־pandas או בכל ספריית עיבוד נתונים מהירה ופשוטה.

from datasets import load_dataset

ds = load_dataset("CShorten/ML-ArXiv-Papers")

הרישיון

הרישיון המדווח של הדאטהסט הוא afl-3.0. רישיון זה מאפשר שימוש חופשי וגם מסחרי, אך דורש מתן קרדיט ושמירה על תנאי הרישיון המקורי בעת הפצה של הנתונים. אם אתם מאמנים מודל על הטקסט, חשוב לבדוק את הרישיונות של המאמרים המקוריים עצמם מתוך ArXiv, כי שדה הרישיון המקורי הושמט מהקובץ הנוכחי.

הרישיון המלא ב־Hugging Face ↗