GPT
S

samsum

קוד פתוח

knkarthickcc-by-nc-nd-4.02022-06-29

  • conversations-summarization

מאגר של שיחות צ'אט יומיומיות באנגלית עם תקצירים שנכתבו בידי אדם. הוא מיועד למי שרוצה ללמד מודל לתמצת הודעות וואטסאפ ומסנג'ר במקום מאמרים אקדמיים או חדשות.

  • 6,598הורדות בחודש
  • 42לייקים

מה זה

המאגר כולל 16,369 שיחות שנכתבו מאפס על ידי בלשנים דוברי אנגלית, ולא נשלפו משיחות פרטיות אמיתיות. הכותבים קיבלו הנחיה לחקות שיחות מסנג'ר אמיתיות שלהם, כך שהטקסט כולל סלנג, שגיאות הקלדה, אימוג'י ומנעד סגנוני שנע בין רשמי ליומיומי מאוד. השיחות מחולקות באופן שווה לארבע קבוצות אורך, בין 3 ל־30 משפטים לשיחה, כאשר כ־75 אחוז מהן מתנהלות בין שני אנשים והשאר בקבוצות גדולות יותר.

לאחר כתיבת הטקסטים, מומחי שפה כתבו תקציר ידני יחיד לכל שיחה. ההנחיה לתקציר דרשה כתיבה בגוף שלישי, הכללת שמות הדוברים, זיקוק המידע המרכזי ושמירה על ניסוח תמציתי. החלוקה במאגר קבועה ומגיעה בשלושה קבצים: 14,732 שיחות לאימון, 818 לוולידציה ו־819 לבדיקה.

מתאים ל

  • בנצ'מרק למודלי תמצות

    מדידת יכולת של מודלי שפה לסכם שיחות מרובות דוברים וסלנג מול תקצירי ייחוס שנכתבו בידי אדם.

  • אימון מודל מחקרי לדיאלוג

    כוונון עדין של מודלים פתוחים לצורך הפקת תקצירים משיחות צ'אט קצרות במסגרת ניסויי מעבדה.

  • בדיקת חילוץ ישויות משיחה

    בחינת יכולת המודל לזהות מי אמר מה ולשמור על שמות הדוברים הנכונים בתוך תקציר מרוכז.

איפה זה נופל

הטקסטים אינם הודעות אמיתיות מתוך אפליקציות אלא תסריטים מומחזים שכתבו בלשנים, ולכן הם עשויים לפספס דפוסים כאוטיים של משתמשי קצה בעולם האמיתי. כל החומרים באנגלית בלבד, ואין כאן אף מילה בעברית או תמיכה בפורמט דו-כיווני. כל שיחה כוללת תקציר ייחוס בודד בלבד, מה שמקשה על הערכה אוטומטית שדורשת גמישות בניסוח. בנוסף, הנתונים הוצגו לראשונה ב־2019, כך שסלנג עדכני או נושאי שיחה חדשים חסרים כאן לחלוטין.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המוצהר הוא CC BY-NC-ND 4.0 שאוסר במפורש שימוש מסחרי. מעבר לכך, התנאי נגד יצירות נגזרות מעמיד בספק את החוקיות של הפצת משקלי מודל שאומנו עליו. הוא מתאים למחקר בלבד.

האם יש בדאטהסט שיחות בעברית?

אין בכלל עברית במאגר, כולו נכתב באנגלית בידי בלשנים. אם המטרה היא תמצות שיחות מקומיות, תצטרכו לתרגם את הנתונים או לחפש מקור אחר שמתאים לעברית. גם מבנה המשפטים והסלנג משקפים שיח אנגלו-סקסי בלבד.

מאיפה הגיעו השיחות ומי כתב אותן?

השיחות לא נאספו מתוך אפליקציות צ'אט של משתמשים אמיתיים בגלל שיקולי פרטיות ואיכות. צוות של בלשנים יצר אותן לפי הנחיות שדימו את התפלגות הנושאים והסגנון בשיחות היומיומיות שלהם במסנג'ר. לאחר מכן מומחי שפה עברו על כל שיחה וכתבו את התקציר.

במה הוא שונה ממאגרי תמצות אחרים כמו חדשות או פגישות?

רוב מאגרי התמצות מתבססים על מאמרי חדשות ארוכים בגוף יחיד או על תמלולי פגישות טכניות וכבדות. המאגר הזה מתמקד בטקסט קצר, לא פורמלי, עם חלוקה ברורה לדוברים, שגיאות כתיב מכוונות וסלנג טיפוסי להודעות טלפון.

איך טוענים

הנתונים יושבים בקובצי CSV פשוטים לפי החלוקה המקורית של אימון, בדיקה ואימות, לצד קובץ הסבר. אין צורך בבקשת גישה מיוחדת או באימות מול המפרסם, וההורדה מיידית. המבנה כולל שלושה שדות בלבד: מחרוזת זיהוי, טקסט השיחה המלא שכולל שמות דוברים ומעברי שורה, והתקציר האנושי. מדובר בטקסט קל משקל של פחות מעשרים אלף רשומות, כך שהוא נטען ישירות לזיכרון בלי שום צורך בחומרה כבדה.

from datasets import load_dataset

ds = load_dataset("knkarthick/samsum")

הרישיון

הרישיון הוא CC BY-NC-ND 4.0, והוא אוסר שימוש מסחרי מכל סוג ומונע הפצת יצירות נגזרות. אי אפשר לשלב אותו במוצר שמייצר הכנסה או לאמן עליו מודל שמיועד לשירות בתשלום. המאגר מיועד למחקר אקדמי, בדיקות פנימיות והשוואת ביצועים בלבד, וכל שימוש בו מחייב מתן קרדיט מלא ליוצרים המקוריים.

הרישיון המלא ב־Hugging Face ↗