GPT
S

scientific_papers

קוד פתוח

armancunknown2022-03-02

  • abstractive-summarization

מאגר מאמרים מדעיים מלאים באנגלית עם תקצירים מתאימים, המיועד למשימות סיכום טקסטים ארוכים. המבנה כולל חלוקה לפסקאות ושמות הפרקים מתוך המקור.

  • 3,969הורדות בחודש
  • 176לייקים

מה זה

הנתונים מחולקים לשני מקורות נפרדים: ArXiv ו־PubMed OpenAccess. המאגר מציע טקסטים מדעיים ארוכים ומובנים יחד עם התקציר שחיברו הכותבים, המשמש כמטרת הסיכום.

כל רשומה מכילה שלושה שדות טקסט בלבד: גוף המאמר המלא (article) עם פסקאות מופרדות בירידת שורה, תקציר המאמר (abstract), ורשימת שמות הפרקים (section_names). בחלק של ArXiv מופיעים סימונים מיוחדים לנוסחאות מתמטיות בטקסט.

מבחינת חלוקה, תת-המאגר של ArXiv כולל 203,037 רשומות אימון, 6,436 רשומות וולידציה ו־6,440 רשומות מבחן. תת-המאגר של PubMed כולל 119,924 רשומות אימון, 6,633 רשומות וולידציה ו־6,658 רשומות מבחן.

מתאים ל

  • אימון סיכום מסמכים ארוכים

    פיתוח מודלים מבוססי חלונות הקשר רחבים שמייצרים תקציר מתוך מאמר מדעי שלם.

  • הערכת מודלי שפה על מדע

    בדיקת יכולת המודל להבין מבנה פסקאות ופרקים אקדמיים בשפה האנגלית.

  • פילוח מקטעים במסמכים

    זיהוי כותרות ופרקים בתוך טקסטים ארוכים באמצעות שדה שמות הפרקים.

איפה זה נופל

הכרטיס משאיר כמעט את כל סעיפי התיעוד ריקים: אין מידע על אופן הסינון, הטיות, או זיהוי מידע אישי ורגיש. הטקסטים מוגבלים לשפה האנגלית בלבד, וסגנון הכתיבה אקדמי ונוקשה, כך שהוא לא מייצג מסמכים עסקיים, משפטיים או עיתונאיים. נוסף לכך, נוסחאות מתמטיות בחלק של ArXiv מוחלפות בתוויות טקסטואליות ולא בנוטציה מלאה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי בעמוד מוגדר כלא ידוע, ובכרטיס אין מידע משפטי. כל עוד יוצרי המאגר לא הגדירו רישיון ברור, לא כדאי להשתמש בו למוצר מסחרי.

כמה מקום בדיסק צריך כדי לעבוד איתו?

קובצי המקור בהורדה שוקלים יחד כ־9.01 גיגה-בייט. לאחר פריסה ויצירת הקבצים המקומיים, נדרש נפח אחסון כולל של 19.10 גיגה-בייט לשני החלקים.

האם המאגר כולל טקסטים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, ומכיל מאמרים מדעיים שפורסמו באנגלית מתוך ArXiv ו־PubMed.

מה ההבדל בין שני החלקים במאגר?

החלק של ArXiv כולל מאמרים בתחומים מדעיים מגוונים עם סימוני נוסחאות, וגדול יותר בהיקפו עם כ־203 אלף רשומות אימון. החלק של PubMed ממוקד ברפואה ומדעי החיים וכולל כ־120 אלף רשומות אימון.

איך טוענים

טוענים את הנתונים באמצעות ספריית datasets של Hugging Face תוך בחירת התצורה הרצויה, arxiv או pubmed. אין צורך באישור גישה מיוחד או בהרשמה.

קובצי ההורדה שוקלים 9.01 גיגה-בייט בסך הכל, 4.50 גיגה-בייט לכל תצורה, אך פריסת הנתונים על הדיסק דורשת שטח משמעותי: 12.09 גיגה-בייט עבור ArXiv ו־7.01 גיגה-בייט עבור PubMed, מה שמסתכם בכ־19.10 גיגה-בייט פנויים הנדרשים בסך הכל.

from datasets import load_dataset

ds = load_dataset("armanc/scientific_papers")

הרישיון

הרישיון מוגדר כ־unknown, ובכרטיס עצמו לא מצוינים תנאי שימוש. למרות שהנתונים נאספו מ־ArXiv וממאגרי גישה פתוחה של PubMed, היעדר רישיון מפורש מונע שימוש מסחרי בטוח. מי שבונה מודל למוצר מסחרי לוקח סיכון משפטי ברור, והשימוש מתאים בעיקר למחקר אקדמי.

הרישיון המלא ב־Hugging Face ↗