GPT
B

booksum

קוד פתוח

kmfodabsd-3-clause2022-03-02

טקסטים ספרותיים ארוכים יחד עם תקצירים אנושיים בשלוש רמות עומק שונות. המאגר נבנה כדי לאמן ולהעריך מודלים על הקשרים עלילתיים מורכבים ולא על ידיעות חדשותיות קצרות.

  • 3,132הורדות בחודש
  • 80לייקים

מה זה

המאגר מכיל יצירות מעולם הספרות כמו רומנים, מחזות וסיפורים קצרים, לצד תקצירים אבסטרקטיביים שנכתבו בידי אדם. התקצירים מחולקים לשלוש רמות קושי והיקף: רמת הפסקה, רמת הפרק ורמת הספר השלם. המבנה הזה נועד לדרוש מהמודל להתמודד עם קשרים כרונולוגיים וסיבתיים לאורך טקסטים ארוכים במיוחד, בשונה ממאגרי סיכום רגילים שמבוססים על כתבות עיתונאיות.

הנתונים במאגר שמורים בקובצי CSV ומחולקים לחלוקה קלאסית של train, dev ו־test. כרטיס המאגר מפנה למאמר המקורי של חוקרי Salesforce ומציג את הבסיס ששימש להערכת מודלים אקסטרקטייביים ואבסטרקטיביים, אך אינו מפרט בכרטיס עצמו אילו ספרים בדיוק נכללו ברשימה או כיצד בוצע הסינון הספציפי של כל יצירה.

מתאים ל

  • אימון סיכום פרקים וספרים

    פיתוח מודלים המסוגלים לעבד נרטיב ארוך ולחלץ תקציר מקיף ברמת הפרק או הספר.

  • הערכת זיכרון ארוך טווח

    בדיקת היכולת של מודלי שפה לשמור על עקביות סיבתית לאורך עשרות אלפי מילים.

  • מחקר על סיכום ספרותי

    השוואה בין תקצירים שנכתבו בידי אדם לבין תוצרי מודלים אבסטרקטיביים שונים.

איפה זה נופל

הנתונים מבוססים על ספרות, ולכן סגנון הכתיבה, אוצר המילים והמבנה התחבירי שונים לחלוטין מטקסטים עסקיים, משפטיים או טכניים. המאגר באנגלית ואין בו שום ייצוג לעברית. אם אתם צריכים לסכם מאמרי חדשות, מסמכים ארגוניים או שיחות, מודל שחונך כאן יתקשה מאוד להפיק תוצאות רלוונטיות. בנוסף, הכרטיס כולל הערה משפטית לפיה האחריות על זכויות היוצרים של הטקסטים שנאספו חלה על המשתמש בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הטכני שדווח הוא BSD 3-Clause שמתיר שימוש מסחרי, אך ההערה המשפטית של החוקרים קובעת שהסקריפטים מיועדים למחקר בלבד. מעבר לכך, הם מבהירים שהאחריות על זכויות היוצרים של הטקסטים עצמם חלה עליכם, ולכן שימוש מסחרי בטוח ידרוש בדיקה של זכויות היוצרים על היצירות שנכללו.

האם יש בדאטהסט טקסטים בעברית?

לא. כל היצירות והתקצירים במאגר הם באנגלית בלבד. אם המטרה שלכם היא מודל לעברית, המאגר הזה לא יספק לכם דוגמאות רלוונטיות.

באיזה פורמט המידע מגיע ואיך הוא מחולק?

המידע מחולק מראש לקובצי train.csv, dev.csv ו־test.csv. החלוקה הפנימית של הדוגמאות מובנית לפי שלוש רמות סיכום: פסקה, פרק, וספר שלם.

במה הוא שונה ממאגרי סיכום נפוצים כמו CNN/DailyMail?

רוב המאגרים מבוססים על כתבות חדשותיות קצרות שבהן המידע החשוב מרוכז בהתחלה. המאגר הזה בנוי על רומנים ומחזות שבהם העלילה מתפתחת לאורך זמן, והתקצירים הם אבסטרקטיביים לחלוטין ונכתבו בידי אנשים.

איך טוענים

הטעינה מתבצעת ישירות מקובצי ה־CSV המוכנים בפיצול ל־train, dev ו־test, ללא צורך באישור גישה מקדים או בהרשמה מיוחדת. המאגר כולל שישה קבצים בסך הכל. לפני שמתחילים לאמן, קחו בחשבון שמדובר בטקסטים ארוכים מאוד ברמת פרק וספר שלם, מה שדורש מודלים עם חלון הקשר רחב ותשתיות זיכרון מתאימות כדי לעבד את הרשומות בשלמותן.

from datasets import load_dataset

ds = load_dataset("kmfoda/booksum")

הרישיון

הרישיון המדווח במאגר הוא BSD 3-Clause, רישיון קוד פתוח מתירני שמאפשר שימוש, שינוי והפצה, כולל שימוש מסחרי, כל עוד שומרים על הודעת זכויות היוצרים והתנאים המקוריים. יחד עם זאת, ההערה המשפטית בכרטיס מגבילה את השימוש בסקריפטים למחקר בלבד ומטילה עליכם את האחריות לזכויות היוצרים על התוכן הספרותי שנאסף.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗