GPT
A

arxiv-summarization

קוד פתוח

ccdvרישיון לא דווח2022-03-02

  • conditional-text-generation

מאגר מאמרים מלאים מתוך ארכיב המיועד למשימות תמצות של מסמכים ארוכים. המטרה כאן היא ללמד מודל לייצר את התקציר מתוך גוף הטקסט המלא.

  • 8,839הורדות בחודש
  • 130לייקים

מה זה

הנתונים מבוססים על עיבוד מחדש של מאגר קודם לתמצות מסמכים ארוכים. כל רשומה כוללת מזהה מאמר, את גוף המאמר המלא ואת התקציר שלו, כאשר המקור עבר פירוק לטוקנים וחבור מחדש באמצעות רווחים וירידות שורה לפסקאות.

החלוקה כוללת שלושה חלקים ברורים. חלק האימון מכיל 203,037 רשומות עם ממוצע של 6038 טוקנים למאמר ו־299 לתקציר. חלק האימות מכיל 6,436 רשומות עם ממוצע של 5894 טוקנים למאמר ו־172 לתקציר, וחלק הבדיקה מכיל 6,440 רשומות עם ממוצע של 5905 טוקנים למאמר ו־174 לתקציר. ספירת הטוקנים מבוססת על רווחים.

מתאים ל

  • אימון מודלים לטקסט ארוך

    התמודדות עם אלפי טוקנים של קלט והפקת תקציר תמציתי ומדויק.

  • הערכת ביצועי תמצות

    בדיקת איכות מודלים מול עשרות אלפי תקצירי מאמרים בחלקי הבדיקה.

  • מחקר על כתיבה מדעית

    ניתוח המבנה והקשר בין גוף מאמר אקדמי באנגלית לתקציר שלו.

איפה זה נופל

הטקסטים כולם באנגלית בלבד ונוגעים לעולם האקדמי המחקרי, כך שאין כאן שום כיסוי לעברית או לסגנון כתיבה עיתונאי ויומיומי. כרטיס המאגר לא מפרט תאריכי איסוף או שיטות סינון לפגמים, והטקסט חובור חזרה מטוקנים קודמים, מה שעלול ליצור בעיות ריווח ופיסוק. אם אתם צריכים לאמן מודל לתוכן שאינו מאמר מדעי באנגלית, זה לא יתאים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. לא דווח שום רישיון במאגר, ולכן אין אישור חוקי לשימוש מסחרי בטקסטים של המאמרים.

האם יש במאגר תמיכה בעברית?

לא. כל המאמרים והתקצירים הם באנגלית בלבד מתוך מאגר ארכיב.

איך הטקסט נאסף ועובד?

הנתונים נלקחו ממאגר קודם לתמצות מסמכים ארוכים של ארמן קוהן. הטקסט המקורי היה מפורק לטוקנים, והיוצרים חיברו אותו חזרה למחרוזת אחת עם רווחים ומעברי שורה לפסקאות.

איך טוענים

אתם טוענים את הנתונים ישירות מספרית הדאטהסטים, ללא צורך בבקשת גישה מיוחדת. המאגר מורכב מ־36 קבצים בפורמט פרקט, כולל קובצי אימון מפוצלים וקובץ בדיקה יחיד. בעבודה עם סקריפטים של טרנספורמרס צריך להגדיר מיפוי של השדות article כקלט ו־abstract כיעד התמצות, לצד שדה ה־id.

from datasets import load_dataset

ds = load_dataset("ccdv/arxiv-summarization")

הרישיון

היוצרים לא דיווחו על רישיון כלל בכרטיס המאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בטקסטים, לא למחקר ובטח שלא למוצר מסחרי. כל אימון של מודל על בסיס הנתונים האלה חושף אתכם לסיכון של הפרת זכויות יוצרים של כותבי המאמרים המקוריים.

הרישיון המלא ב־Hugging Face ↗