GPT
A

arxiv-abstracts-2021

קוד פתוח

gfissorecc0-1.02022-03-02

המאגר מרכז מטא-דאטה ותקצירים של כ־2 מיליון מאמרים מדעיים מ־arXiv עד סוף 2021. הוא מתאים למי שרוצה לאמן מודלים על שפה מדעית באנגלית בלי להסתבך עם הורדות חיצוניות.

  • 4,941הורדות בחודש
  • 41לייקים

מה זה

המאגר מכיל כ־2 מיליון רשומות של מאמרים מדעיים שהוגשו ל־arXiv עד סוף שנת 2021. הנתונים מכסים קשת רחבה של תחומים אקדמיים, החל מפיזיקה, מתמטיקה ומדעי המחשב, ועד ביולוגיה כמותית, סטטיסטיקה וכלכלה. כותבי הטקסטים הם חוקרים ואנשי אקדמיה מרחבי העולם, ללא תלות במוסד ספציפי.

כל רשומה כוללת את פרטי המטא-דאטה של המאמר: מזהה ייחודי, שם המגיש, שמות המחברים המלאים, כותרת, תקציר, קטגוריות ונושאים במערכת, וכן הערות, הפניות לכתבי עת ומספרי DOI ודוחות אם היו קיימים. הקובץ מגיע בשלמותו ללא חלוקה מובנית לסטים של אימון, בדיקה או ולידציה, כך שאת החלוקה הזו אתם עושים בעצמכם. הכרטיס אינו מפרט את תהליך הנרמול או הסינון המדויק שבוצע על הנתונים.

מתאים ל

  • אימון מנועי חיפוש סמנטי

    התאמת כותרות לתקצירים כדי לבנות אחזור מידע מדויק במאגרים אקדמיים.

  • סיווג מאמרים לקטגוריות

    חיזוי תגיות הנושא של המאמר על בסיס הטקסט החופשי של התקציר.

  • יצירת כותרות מתקציר

    אימון מודלים של סיכום טקסט קצר ליצירת כותרת מדעית מתוך תקציר מלא.

איפה זה נופל

הנתונים נעצרים בסוף 2021, כך שכל ההתפתחויות והמחקרים שנכתבו מאז פשוט לא קיימים כאן. הטקסט כולו באנגלית בלבד, ואין פה תוכן מלא של מאמרים אלא תקצירים בלבד. שמות המחברים מופיעים במלואם כפי שנמסרו, והכרטיס מציין שחסר מידע לגבי הטיות קיימות, סינונים או מגבלות חברתיות בנתונים. לפני שילוב במוצר צריך לבדוק היטב כיצד המודל מתמודד עם טרמינולוגיה מדעית מיושנת או חסרה.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן, המאגר פורסם תחת רישיון נחלת הכלל CC0 1.0. הרישיון הזה מוותר על כל זכויות היוצרים ומאפשר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים למוצרים מסחריים בלי צורך באישור או במתן קרדיט.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. כל התקצירים, הכותרות ושמות התחומים נכתבו באנגלית על ידי קהילת החוקרים. אם אתם מחפשים לאמן מודלים לשפה העברית, המאגר הזה לא יתאים.

מה ההבדל בינו לבין arxiv_dataset הסטנדרטי?

ההבדל העיקרי הוא שהקבצים כאן זמינים להורדה ישירה מתוך המאגר ללא צורך בסקריפטים חיצוניים. מצד שני, המאגר הזה מוגבל בזמן ומכיל רק עבודות שהוגשו עד סוף 2021. הוא לא מקבל עדכונים שוטפים על מאמרים חדשים שיצאו מאז.

איך נאספו הנתונים שבמאגר?

הנתונים מבוססים על מאגר המטא-דאטה הציבורי של arXiv שמתעד את המאמרים המוגשים אליו לאורך השנים. יוצר הדאטהסט ארז את הרשומות עד סוף 2021 לתוך קובץ מרוכז. בכרטיס המאגר מצוין שחסר פירוט על תהליכי ניקוי או נרמול ספציפיים שנעשו.

איך טוענים

הנתונים יושבים בקובץ מכווץ בפורמט jsonl.gz לצד קובץ התיעוד, כך שאין צורך באישור גישה מיוחד או בהורדה משרתים חיצוניים. פורסים את הקובץ וטוענים אותו ישירות לתוך קוד הפייתון שלכם. השדות המרכזיים לעבודה עם מודלי שפה הם הכותרת והתקציר לצד הקטגוריות לסיווג, ומזהה המאמר מאפשר לחזור לטקסט המקורי במידת הצורך.

from datasets import load_dataset

ds = load_dataset("gfissore/arxiv-abstracts-2021")

הרישיון

המאגר שוחרר תחת רישיון CC0 1.0, שמקדיש את המידע לנחלת הכלל. הרישיון מתיר שימוש מסחרי ומחקרי חופשי לחלוטין, ללא חובת ייחוס וללא דרישה לשתף תוצרים באותו הרישיון. מותר לאמן עליו מודלים סגורים או פתוחים ללא הגבלות זכויות יוצרים על הדאטה עצמו.

הרישיון המלא ב־Hugging Face ↗