GPT
B

Bitext-customer-support-llm-chatbot-training-dataset

קוד פתוח

bitextcdla-sharing-1.02023-08-24

  • question-answering
  • llm
  • chatbot
  • customer-support
  • conversional-ai

מאגר סינתטי של 26,872 פניות שירות ותשובות באנגלית, שנועד לאימון עוזרים וירטואליים. היתרון שלו הוא תיוג עשיר של שגיאות כתיב, שפה בוטה ורמות שונות של נימוח.

  • 5,608הורדות בחודש
  • 190לייקים

מה זה

הנתונים מחולקים לזוגות של הנחיית משתמש ותשובת עוזר, עם סך כולל של 3.57 מיליון טוקנים. הרשומות ממוינות לעשרה תחומים מרכזיים ובהם 27 כוונות פנייה, כמו ביטול הזמנה, עריכת חשבון או בירור מדיניות החזרים, עם כאלף דוגמאות לכל כוונה. כל שורה מכילה גם תיוגי ישויות כמו מספרי הזמנה וחשבוניות שמוטמעים בתשובות.

הבנייה נעשתה בשיטה היברידית. צוות המפתחים לקח טקסטים מקוריים מתוך מאגר של עשרים ענפי תעשייה, חילץ מהם גרעיני שיחה באמצעות כלי עיבוד שפה, והרחיב אותם בעזרת מחוללי שפה מלאכותיים. לאורך התהליך, בלשנים חישוביים פיקחו על התוצאות והצמידו תיוגים לסגנונות ניסוח, החל מקיצורים ושגיאות הקלדה ועד למבנים תחביריים מורכבים.

מתאים ל

  • אימון מזהה כוונות

    חלוקת הדוגמאות לפי 27 כוונות מאפשרת לאמן מודל סיווג יעיל לפניות תמיכה נפוצות.

  • עמידות לשגיאות הקלדה

    סינון לפי תגית השגיאות מכין מודלי שפה להתמודד עם טעויות כתיב וסלנג בלי לקרוס.

  • שלב ראשון בהתאמת מודל

    שימוש בטקסטים כבסיס ידע לתמיכת לקוחות לפני ביצוע פיין-טיונינג על נתונים פנימיים.

איפה זה נופל

כל הטקסטים נבנו באנגלית בלבד, כך שלמי שבונה בוט בעברית אין פה שימוש ישיר. מעבר לכך, התשובות מכילות משתנים גנריים בתוך סוגריים מסולסלים ולא ערכים חיים, מה שמחייב התאמה לוגית לפני שמחברים אותו למערכת פעילה. מדובר בדאטהסט היברידי ומפוקח, לכן הוא נוטה לסטריליות יחסית ולא מייצג עד הסוף את הבלגן והגמגום של שיחות צ'אט אותנטיות מהעולם האמיתי.

שאלות
נפוצות

האם הדאטהסט כולל תמיכה בעברית?

לא. כל 26,872 הדוגמאות נכתבו באנגלית בלבד. אם אתם בונים שירות לקוחות לשוק הישראלי, תוכלו להשתמש בו לכל היותר כהשראה למבנה הכוונות והישויות.

מאיפה הגיעו הנתונים ואיך ייצרו אותם?

הנתונים לא נלקחו מיומני שיחות של לקוחות אמיתיים. החברה לקחה טקסטים טבעיים מעשרים ענפי מסחר, חילצה מהם משפטי בסיס, והרחיבה אותם סינתטית בעזרת מודלי שפה ותחת פיקוח של בלשנים.

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון cdla-sharing-1.0 מאפשר עבודה מסחרית, אך הוא מחייב לצרף ייחוס למקור. אם אתם משנים את קובץ הנתונים עצמו ומפיצים אותו, תצטרכו לשתף את השינויים תחת אותו הרישיון.

מה מבדיל אותו מסתם אוסף שיחות תמיכה?

היתרון כאן הוא עמודת התגיות הלשוניות. אפשר לבודד בקלות פניות שמכילות שפה פוגענית, סלנג, שאלות ישירות או שגיאות כתיב, ולהתאים את האימון לאופי השיחה שתרצו ללמד.

איך טוענים

המאגר זמין להורדה ישירה ללא צורך בהרשאה או בטופס גישה. המשקל שלו קל והוא מופץ כקובץ CSV בודד, Bitext_Sample_Customer_Support_Training_Dataset_27K_responses-v11.csv. השדות החשובים לעבודה הם instruction לפלחי הקלט, response לתשובות, והעמודות category ו־intent למיון. שדה ה־flags חיוני במיוחד אם אתם רוצים לסנן מראש רק פניות עם שגיאות כתיב, סלנג או ניסוחים תוקפניים.

from datasets import load_dataset

ds = load_dataset("bitext/Bitext-customer-support-llm-chatbot-training-dataset")

הרישיון

המאגר שוחרר תחת רישיון cdla-sharing-1.0. זהו רישיון שיתופי שמותר לשימוש מסחרי, אך הוא דורש מתן קרדיט ושיתוף של שינויים שתבצעו בדאטהסט עצמו תחת אותם תנאים. לגבי מודלים שאומנו עליו, הרישיון מבדיל לרוב בין הנתונים לבין תוצרי החישוב, אך אם אתם מתכוונים להפיץ את המשקולות של המודל בתוך מוצר מסחרי, כדאי לבדוק את הדרישות מול ייעוץ משפטי.

הרישיון המלא ב־Hugging Face ↗