GPT
D

dialogsum

קוד פתוח

knkarthickcc-by-nc-sa-4.02022-06-28

  • dialogue-summary
  • one-liner-summary
  • meeting-title
  • email-subject

שיחות יומיומיות מתוסרטות באנגלית עם סיכומים וכותרות שנכתבו בידי מומחי שפה. המאגר מתאים למי שרוצה לאמן מודל לתמצת שיחות שירות או דיאלוגים קצרים בגוף שלישי.

  • 10,427הורדות בחודש
  • 248לייקים

מה זה

המאגר מכיל 13,460 שיחות מרובות דוברים, לצד עוד 100 דוגמאות בסט נפרד. הטקסטים נאספו משלושה מאגרים קיימים, Dailydialog, DREAM ו־MuTual, וכן מאתר לתרגול אנגלית מדוברת. התכנים מציגים סיטואציות יומיומיות מגוונות כמו עבודה, לימודים, קניות, פנאי ורפואה, בעיקר בין חברים, קולגות או נותני שירות ולקוחות.

כל רשומה מורכבת מארבעה שדות: מזהה ייחודי, תמלול השיחה שבו הדוברים מסומנים בתגיות קבועות, תקציר שנכתב ידנית בידי אנשי מקצוע, וכותרת תמציתית של נושא השיחה. ההנחיות למתייגים דרשו ניסוח תמציתי מנקודת מבט של צופה חיצוני, שמירה על ישויות שמיות מרכזיות ושימוש בשפה רשמית.

החלוקה הפנימית מפרידה את הנתונים ל־12,460 דוגמאות אימון, 500 דוגמאות אימות ו־1,500 דוגמאות בדיקה. קובץ ה־holdout הנפרד כולל 100 שיחות המכילות מזהה, טקסט ונושא בלבד, ללא שדה הסיכום.

מתאים ל

  • אימון מודל לתקצור שיחות

    לימוד מודלים לחלץ את עיקרי הדברים מתוך דיאלוג בין שני אנשים ולנסח אותם כפסקה רשמית.

  • חילוץ נושא מרכזי מדיאלוג

    שימוש בשדה הנושא לאימון מודלים שמייצרים כותרת קצרה של שורה אחת לשיחה.

  • הערכת ביצועי מודלי שפה

    בדיקת איכות יצירת טקסט על סט הבדיקה שכולל 1,500 שיחות מתוסרטות עם סיכומי ייחוס אנושיים.

איפה זה נופל

המאגר כולו באנגלית בלבד ומבוסס על תרגולי שפה ומאגרים קיימים, לא על שיחות אמיתיות שהוקלטו בשטח. הדיאלוגים מנומסים ומסודרים מדי יחסית לעולם האמיתי, ללא קטיעות דיבור, רעשי רקע או טעויות הקלדה. לא הייתי משתמש בזה לאימון מערכת לשירות לקוחות חי בלי הוספת דאטה מלוכלך ומקומי. בנוסף, המתייגים כתבו את הסיכומים בשפה רשמית מאוד וממבט חיצוני, מה שלא מתאים למי שמחפש תקציר בגוף ראשון או בסגנון חופשי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא רישיון לא מסחרי, CC BY-NC-SA 4.0. מותר לחקור, ללמוד ולהעריך מודלים, אבל לא להשתמש בנתונים כדי לאמן מערכות שמיועדות לשימוש מסחרי בחברה.

האם יש במאגר שיחות בעברית?

אין עברית כלל. כל 13,460 השיחות הן באנגלית בלבד, ומקורן במאגרים אקדמיים ובאתר לתרגול אנגלית מדוברת.

מאיפה הגיעו השיחות שבמאגר?

החוקרים אספו את השיחות משלושה מאגרים פתוחים קיימים, Dailydialog, DREAM ו־MuTual, וכן מאתר שנועד לתרגול אנגלית. לאחר מכן הם שכרו מומחי שפה שכתבו את הסיכומים והנושאים לפי כללים מוגדרים מראש.

מה ההבדל בין קובץ ה־test לקובץ ה־holdout?

קובץ ה־test כולל 1,500 שיחות מלאות יחד עם סיכומים ונושאים לצורך בדיקת ביצועי מודל התקצור. קובץ ה־holdout מכיל 100 שיחות בלבד, ומופיעים בו מזהה, טקסט השיחה ושדה הנושא, ללא שדה הסיכום.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך בבקשת גישה מיוחדת או באישור ידני. הקבצים שמורים במאגר בפורמט CSV סטנדרטי המחולק לקובצי אימון, בדיקה, אימות וקובץ ה־holdout, כך שניתן לקרוא אותם ישירות גם באמצעות פנדס. השדות המרכזיים לעבודה הם dialogue כקלט ו־summary כמטרה למודל התקצור. אם המטרה היא יצירת כותרות או סיווג נושאי, שדה ה־topic הוא המטרה שלכם. הפורמט של השיחות כולל סימונים מובנים לדוברים שדורשים לעיתים ניקוי או התאמה מראש לפרומפט שאתם בונים.

from datasets import load_dataset

ds = load_dataset("knkarthick/dialogsum")

הרישיון

הרישיון הוא CC BY-NC-SA 4.0. המשמעות ברורה: שימוש מחקרי ולא מסחרי בלבד. אסור לשלב את המאגר או להשתמש בו ישירות במוצר שמייצר הכנסות. אם אתם מאמנים עליו מודל או מפיצים גרסה מעובדת שלו, אתם חייבים לתת קרדיט למחברים המקוריים ולשחרר את התוצר תחת אותו רישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗