GPT
A

arxiver

קוד פתוח

neuralworkcc-by-nc-sa-4.02024-10-14

מאגר של מאמרים מדעיים שעברו המרה למרקדוואן קריא במקום קובצי PDF נעולים. הוא מתאים למי שרוצה לאמן מודלים על טקסט אקדמי בלי להסתבך עם חילוץ תבניות ונוסחאות.

  • 896הורדות בחודש
  • 368לייקים

מה זה

המאגר מכיל 63,357 מאמרים מאתר arXiv שפורסמו בטווח חודשים מצומצם, בין ינואר 2023 לאוקטובר 2023. כל רשומה כוללת את מזהה המאמר המקורי, כותרת, תקציר, רשימת מחברים, תאריך פרסום, קישור ישיר לקובץ המקור וטקסט המאמר המלא בפורמט מולטי מרקדוואן.

תהליך הבנייה התבסס על מודל הראייה הממוחשבת Nougat, שסרק את מסמכי ה־PDF והמיר אותם לטקסט מעוצב. לאחר מכן הופעל עיבוד שכלל חילוץ פרטי המחברים, הסרה יזומה של רשימות המקורות בסוף המאמרים וניקוי רווחים ועימוד. הנתונים מרוכזים בפיצול יחיד של אימון בקובץ פרקט.

מתאים ל

  • אימון מודלים אקדמיים

    התאמת מודלי שפה לקריאה והבנה של ניסוחים מדעיים מורכבים במרקדוואן.

  • מערכות שאלות ותשובות

    בניית כלי חיפוש סמנטי שמאתר תשובות מדויקות מתוך גוף המאמרים.

  • סיכום טקסטים ארוכים

    אימון מודלים להפקת תקצירים קצרים מתוך תוכן מלא של מחקר מדעי.

איפה זה נופל

הטקסטים הופקו באמצעות מודל OCR, מה שאומר שעלולות להיות שגיאות פענוח במקומות שבהם הסריקה התבלבלה, במיוחד בטבלאות סבוכות או סימנים מתמטיים נדירים. כל המאמרים נאספו מטווח של עשרה חודשים בלבד בשנת 2023, כך שאין כאן כיסוי היסטורי ולא ידע עדכני מעבר לתקופה הזו. בנוסף, רשימות המקורות הוסרו לחלוטין, עובדה שפוסלת את המאגר מניתוח גרף ציטוטים, והשפה היא כמעט בלעדית אנגלית אקדמית ללא שום ייצוג לעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון המוצהר הוא רישיון לא מסחרי שמגביל את השימוש למחקר ולמטרות אישיות בלבד. אם תאמנו עליו מודל שיימכר כשירות, תפרו את תנאי השימוש. מעבר לכך, כל תוצר נגזר חייב להיות מופץ באותו רישיון חופשי.

כמה שטח אחסון צריך בשביל להוריד אותו?

המאגר דורש 1.44 גיגה בייט בדיסק, שזה נפח קטן מאוד בהשוואה למאגרי טקסט גולמיים. אפשר גם להפעיל אותו במצב הזרמה בלי להוריד את הקבצים מראש.

האם יש במאגר טקסטים בעברית?

אין במאגר עברית. מדובר במאמרים מדעיים מאתר arXiv מתחומי המדעים המדויקים והטכנולוגיה, וכולם כתובים באנגלית אקדמית בלבד.

איך הטקסט נאסף ועובד בפועל?

היוצרים לקחו קובצי PDF של מאמרים והעבירו אותם דרך מודל הראייה הממוחשבת Nougat. לאחר החילוץ, הם ניקו את הטקסט, חילצו את פרטי המחברים והורידו את רשימות המקורות בסוף כדי להשאיר רק תוכן נקי.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הפקודה הרגילה, בלי צורך באישור גישה או מפתח מיוחד. הנפח הכולל של הקבצים עומד על 1.44 גיגה בייט, כך שהוא יורד מהר מאוד בדיסק מקומי. למי שרוצה לחסוך מקום או רק לבדוק דגימות, יש תמיכה מלאה בהזרמה ישירה בלי הורדה שלמה מראש. השדות השימושיים ביותר לעיבוד הם תוכן המרקדוואן והתקציר.

from datasets import load_dataset

ds = load_dataset("neuralwork/arxiver")

הרישיון

הרישיון כאן הוא CC BY-NC-SA 4.0, מה שאומר שאסור להשתמש בנתונים האלה לשום מטרה מסחרית. מעבר לזה, כל מודל או מאגר שנגזר מהם מחייב מתן קרדיט מלא למפרסמים והפצה תחת אותו רישיון מגביל בדיוק. זה כלי למחקר בלבד, וכל חברה שמחפשת נתונים למוצר שלה צריכה לדלג הלאה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗