GPT
P

peS2o

קוד פתוח

allenaiodc-by2023-06-29

  • biology
  • chemistry
  • engineering
  • computer science
  • physics

מאגר ענק של עשרות מיליוני מאמרים אקדמיים מסוננים באנגלית מלאה. הוא נבנה בדיוק עבור מי שצריך לאמן מודלי שפה על תוכן מדעי נקי בלי לגרד ולנקות PDF-ים לבד.

  • 20,672הורדות בחודש
  • 203לייקים

מה זה

המאגר מבוסס על Semantic Scholar Open Research Corpus ומכיל שתי תצורות תוכן. החלק הראשון נלקח ממאמרים בגישה חופשית בטקסט מלא שחולצו באמצעות Grobid, ללא טבלאות, תמונות והפניות ביבליוגרפיות. החלק השני מורכב מכותרות ותקצירים בלבד שמקורם במטא-דאטה של המערכת.

הסינון קפדני מאוד. המפתחים השמיטו מאמרים שפורסמו לפני שנת 1970 כדי להימנע משגיאות סריקה ישנות, הגבילו את השפה לאנגלית בלבד באמצעות pycld3, וזרקו פסקאות עם שכיחות מילים חריגה לפי מודל שפה של גוגל. בגרסה השנייה הוסיפו בדיקות ביטויים רגולריים כדי להעיף תקצירים שבהם הוכנסו רווחים בין אותיות בגלל קריאת טקסט משובשת.

מתאים ל

  • אימון מקדים של מודלי שפה

    הזנת טקסט מדעי נקי ומסונן לבסיס של מודל שפה כללי או ייעודי.

  • הערכת ביצועים בתחום המדעי

    בדיקת יכולות הבנה והשלמת מילים על טקסטים אקדמיים עדכניים עד 2023.

  • שליפת מטא-דאטה ומחקר

    הצלבת מזהי המאמרים מול ה־API החיצוני כדי לחקור רשתות ציטוטים.

איפה זה נופל

המאגר מוגבל אך ורק לאנגלית, כך שאין כאן שום ייצוג לעברית או לשפות אחרות. נקודת החיתוך של הנתונים נעצרת בתחילת ינואר 2023, ולכן מחקרים עדכניים מהתקופה האחרונה פשוט לא קיימים בו. בנוסף, חילוץ המידע הסיר לחלוטין נוסחאות, טבלאות וגרפים, מה שמשאיר רק את המלל הגולמי ומקשה על מודלים שצריכים להבין מבנה נתונים כמותי במדעים מדויקים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

כן, רישיון ODC-By מאפשר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט וייחוס ליוצרים לפי ההנחיות שלהם.

האם המאגר כולל טקסטים בעברית?

לא. תהליך הסינון של המאגר זרק באופן יזום כל טקסט שלא זוהה כאנגלית באמצעות ספריית הזיהוי pycld3.

מה ההבדל בין גרסה 1 לגרסה 2 של המאגר?

גרסה 2 כוללת מנגנון סינון נוסף שמסיר שגיאות סריקה אופטית מתקצירים. היא מכילה פחות מסמכים בסך הכל, אך רמת הניקיון של הטקסט גבוהה יותר.

האם המאמרים כוללים את הטבלאות והגרפים המקוריים?

לא, תהליך העיבוד הוציא החוצה תמונות, טבלאות ורשימות מקורות. המאגר מכיל אך ורק את פסקאות הטקסט הרציפות והכותרות שלהן.

איך טוענים

הקבצים יושבים במאגר בפורמט json.gz מחולק ומוכנים לקריאה ישירה. אפשר לטעון אותם בספריות סטנדרטיות בלי לבקש אישור גישה מוקדם או להמתין למפתח. כל רשומה כוללת את הטקסט הנקי כשהפסקאות מופרדות בשתי ירידות שורה, לצד שדות חשובים כמו מקור המידע, שנת פרסום מוערכת ומזהה מסמך שמאפשר למשוך מידע נוסף ישירות מה־API של Semantic Scholar.

from datasets import load_dataset

ds = load_dataset("allenai/peS2o")

הרישיון

המאגר מופץ תחת רישיון ODC-By. מותר להשתמש בו לצרכים מחקריים ומסחריים, כולל אימון מודלים, בתנאי שנותנים קרדיט ברור ליוצרים לפי דרישות הרישיון. אין חובה לשתף את המודל או את התוצרים באותו רישיון.

הרישיון המלא ב־Hugging Face ↗