GPT
C

customer-support-tickets

קוד פתוח

Tobi-Bueckcc-by-nc-4.02025-02-06

  • ticketsystem
  • helpdesk
  • customer
  • support
  • ticket

מאגר כרטיסי תמיכה סינתטיים באנגלית ובגרמנית עם תיוגי תורים, עדיפויות ותשובות סוכן. הוא מתאים למי שרוצה לאמן מודל ניתוב פניות בלי להתעסק בבעיות פרטיות של מידע אמיתי.

  • 2,521הורדות בחודש
  • 31לייקים

מה זה

המאגר כולל בין עשרת אלפים למאה אלף רשומות המדמות פניות תמיכה של לקוחות ותשובות של נציגי שירות. הנתונים לא נלקחו ממוקד תמיכה חי אלא נוצרו באופן סינתטי באמצעות מחולל כרטיסים ייעודי, מה שמבטיח שאין בהם מידע מזהה אישי. כל רשומה מייצגת פנייה ומכילה שדות של נושא, גוף ההודעה, תגובת הסוכן, שפת הפנייה וסוג העסק, לצד תיוגים של סוג הפנייה, מחלקת היעד, רמת הדחיפות ותגיות נוספות.

הכרטיס מציג שתי גרסאות של המאגר שנמצאות בקבצים נפרדים. הגרסה החדשה יותר מכילה יותר כרטיסים אבל מוגבלת לאנגלית ולגרמנית בלבד, בעוד הגרסה הקודמת מכילה קבצים עם חלוקה שונה. התיוגים במאגר מפורטים מאוד ומחלקים את הפניות לעשרה תורים שונים כמו תמיכה טכנית, שירות לקוחות ותשלומים, שלוש רמות דחיפות מאחת עד שלוש, וארבעה סוגי כרטיסים הכוללים תקלות, בקשות שגרתיות, בעיות מערכתיות ושינויים מתוכננים. התגיות הנושאיות מפוצלות בפועל לעשר עמודות שונות בתוך הקבצים.

מתאים ל

  • סיווג וניתוב פניות

    אימון מודל שמזהה את נושא הפנייה ומנתב אותה אוטומטית למחלקה המתאימה בארגון לפי עשרת התורים המוגדרים.

  • חיזוי דחיפות כרטיסים

    בניית מנגנון תעדוף שמסווג פניות לשלוש רמות דחיפות כדי להקפיץ תקלות קריטיות לראש התור.

  • יצירת מענה אוטומטי

    אימון מודלים של שאלה ותשובה על בסיס הטקסט של הלקוח ותשובת הסוכן לצורך הצעת מענה מהיר.

איפה זה נופל

החיסרון הברור ביותר הוא שהמידע סינתטי לחלוטין. הוא נוצר במחולל ולכן עלול לפספס ניואנסים, שגיאות הקלדה, סלנג ותסכול שמאפיינים לקוחות אמיתיים בזמן אמת. בנוסף, המאגר מוגבל רק לאנגלית ולגרמנית, כך שאין בו תמיכה בעברית והוא לא יעזור בבניית מערכת מקומית בלי תרגום או אימון מקביל. לא הייתי מכניס מודל שאומן עליו ישירות לפרודקשן מול לקוחות בלי לבדוק קודם איך הוא מתמודד עם דאטה אמיתי מהמוקד שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון של המאגר הוא cc-by-nc-4.0 שמונע במפורש כל שימוש מסחרי. מותר להשתמש בו לניסויים, מחקר ואימון מודלים פנימיים שאינם חלק ממוצר שנמכר. אם אתם צריכים דאטה למערכת מסחרית, תצטרכו לפנות ליוצר או לחפש מקור אחר.

האם הדאטהסט כולל פניות בעברית?

לא, המאגר הזה כולל אך ורק פניות באנגלית ובגרמנית. היוצר מציין קבצים אחרים שלו שכוללים שפות כמו צרפתית וספרדית, אבל עברית לא קיימת באף גרסה. כדי לעבוד בעברית תצטרכו לתרגם את הטקסטים או לאסוף דאטה ייעודי.

מאיפה הנתונים האלה הגיעו ואיך הם נאספו?

הנתונים לא נאספו מלקוחות אמיתיים ולא נלקחו ממוקד תמיכה פעיל. הם יוצרו בצורה מלאכותית על ידי כלי ייעודי לייצור כרטיסי תמיכה סינתטיים של חברת Softoft. המטרה של הגישה הזו היא לייצר מבנה נתונים מסודר שאינו מכיל פרטים אישיים מזהים.

מה ההבדל בין הקבצים השונים במאגר?

המאגר מחולק לשתי גרסאות עיקריות שנשמרות בקבצים נפרדים. הגרסה החדשה מכילה כמות גדולה יותר של פניות אך ממוקדת רק באנגלית ובגרמנית, כולל קובץ מנורמל ייעודי לגרמנית. הגרסאות האחרות מייצגות חלוקות ישנות יותר או קבצים רב לשוניים עם היקף שונה.

איך טוענים

הנתונים מגיעים בחמישה קבצים, רובם קובצי CSV פשוטים כמו dataset-tickets-german_normalized_50_5_2.csv או גרסאות רב לשוניות אחרות. אין צורך לבקש אישור גישה מיוחד, אפשר להוריד אותם ישירות ולטעון באמצעות פנדס או מודול הדאטהסטס של האגינג פייס. לפני שמתחילים לעבוד, שימו לב שיש שתי גרסאות שונות של הנתונים במאגר וצריך לבחור את הקובץ המתאים למשימה שלכם. השדות המרכזיים לעיבוד הם שדות הטקסט של הפנייה והתשובה לצד עמודות הסיווג של המחלקה והעדיפות, כאשר התגיות עצמן מפוצלות על פני עשר עמודות נפרדות ודורשות איחוד או ניקוי מוקדם.

from datasets import load_dataset

ds = load_dataset("Tobi-Bueck/customer-support-tickets")

הרישיון

המאגר פורסם תחת רישיון cc-by-nc-4.0. המשמעות היא שמותר להשתמש בנתונים למחקר, בדיקות פנימיות ופיתוח מודלים לצרכים לימודיים, תוך מתן קרדיט מתאים ליוצר. עם זאת, נאסר כל שימוש מסחרי במאגר. אם אתם מתכננים לאמן מודל שיוטמע במוצר מסחרי או יימכר ללקוחות, הרישיון הזה פוסל את השימוש בו לחלוטין.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗