GPT
A

arxiv-papers-by-subject

קוד פתוח

permutansmit2025-12-20

  • arxiv
  • academic-papers
  • scientific-literature
  • research
  • metadata

מטא-דאטה מובנה של כ־2.55 מיליון מאמרים מ־arXiv בחלוקה לקבצי פארקט לפי נושא, שנה וחודש. מתאים במיוחד למי שצריך לחלץ תקצירים מתחום ספציפי בלי להוריד עשרות ג'יגה-בייט מיותרים.

  • 154,624הורדות בחודש
  • 35לייקים

מה זה

המאגר כולל רשומות מטא-דאטה בלבד, שנגזרו מתוך המאגר המקורי של nick007x ומקורן הראשוני בארכיב המאמרים של אוניברסיטת קורנל. כל שורה מייצגת מאמר ומכילה את המזהה שלו, כותרת, רשימת מחברים, תאריך הגשה, הערכות מחבר, קטגוריה ראשית, כלל הקטגוריות, מזהה DOI, תקציר, ונתיב המוביל לקובץ ה־PDF במאגר המקורי.

במקום קובץ ענק אחד, הנתונים מחולקים לעץ תיקיות לפי 148 או 167 קטגוריות נושא, משנת 1989 או 1998 ועד 2025, ובתוכן לפי חודשים. המבנה הזה מאפשר לקרוא ישירות רק חודש בודד או תחום ממוקד כמו בינה מלאכותית, פיזיקה או כלכלה בלי להתעסק בסינון של כלל המאגר.

מתאים ל

  • שליפת נתונים לתחום מוגדר

    הורדה ממוקדת של תקצירי מאמרים מתחום מסוים, כמו מדעי המחשב או פיזיקה, לפי חודשים ושנים.

  • אימון מודלי שפה ותקצור

    יצירת מאגר אימון להפקת תקצירים אקדמיים או חילוץ תובנות מכותרות ותקצירים באנגלית.

  • בניית אמבדינגס לחיפוש

    חילוץ וקטורים מייצגים לחיפוש סמנטי והמלצת מאמרים רלוונטיים לחוקרים.

איפה זה נופל

אין במאגר הזה את גוף המאמרים המלא, אלא תקצירים ומטא-דאטה בלבד. נתיבי הקבצים בשדה file_path מפנים לקבצי ZIP במאגר המקורי של nick007x ולא קיימים כאן ישירות. השפה היא אנגלית בלבד, ואין שום ייצוג לעברית. בנוסף, קיימת אי-התאמה בתיעוד לגבי שנת ההתחלה, שמצוינת פעם אחת כ־1989 ופעם כ־1998, ולגבי מספר הקטגוריות, מה שמחייב לבדוק את טווחי הזמן והתגיות בפועל לפני שבונים תהליך עיבוד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

חלוקת הקבצים והארגון מוגדרים תחת רישיון MIT שמאפשר שימוש מסחרי. יחד עם זאת, התוכן של כל מאמר ותקציר שייך למחבריו ב־arXiv, ולכן תצטרכו לבדוק את תנאי הפרסום של המאמרים עצמם לפני שימוש ישיר בתוכן למוצר.

האם המאגר כולל את הטקסט המלא של המאמרים?

לא. המאגר מכיל רק מטא-דאטה, תקצירים ונתיב לקובץ ה־PDF שנמצא במאגר מקור נפרד. אי אפשר לקרוא ממנו את תוכן המאמר מעבר לתקציר.

האם יש במאגר מאמרים בעברית?

המאגר מוגדר לשפה האנגלית בלבד. כל התקצירים והכותרות מגיעים מ־arXiv וכתובים באנגלית.

מה ההבדל בינו לבין המאגר המקורי של nick007x?

המאגר המקורי מאחסן את הכל כגוש אחד שמחייב הורדה מלאה וכולל גם גישה לקבצים. הגרסה הזו מפרקת כ־2.55 מיליון רשומות לעשרות אלפי קבצי Parquet קטנים כדי שתוכלו להוריד רק את הנושא והשנה שמעניינים אתכם.

איך טוענים

טוענים את הנתונים דרך ספריית huggingface_hub באמצעות הורדת קובץ בודד עם hf_hub_download או משיכת תבנית קבצים עם snapshot_download. המאגר מכיל 42,778 קבצי Parquet מכווצים ואין צורך בבקשת גישה מיוחדת. הכלים המומלצים לעבודה מקומית הם ספריות כמו Polars שמאפשרות לבצע סריקה עצלה ישירות על נתיבי הקבצים בעזרת ביטויים רגולריים, בלי להעמיס את כל הזיכרון.

from datasets import load_dataset

ds = load_dataset("permutans/arxiv-papers-by-subject")

הרישיון

האריזה וארגון הנתונים מופצים תחת רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה תחת ייחוס. עם זאת, התוכן של כל תקציר ומאמר כפוף לרישיון הפרטני שבו המחברים שחררו אותו ב־arXiv. אם אתם מאמנים מודל על הטקסטים עצמם, עליכם לוודא שהרישיונות של המאמרים הספציפיים מתירים את סוג השימוש שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗