GPT
A

apptek_callcenter_dialogues

קוד פתוח

apptek-comcc-by-sa-4.02026-04-23

  • audio
  • automatic-speech-recognition
  • speech
  • conversational-speech
  • long-form

המאגר מרכז מעל 128 שעות של שיחות שירות לקוחות מבויימות באנגלית, ומיועד לבחינת מודלי תמלול על 14 מבטאים שונים. הוא מתאים למי שרוצה לבדוק עמידות מודל בדיבור ספונטני וארוך.

  • 2,110הורדות בחודש
  • 36לייקים

מה זה

הנתונים כוללים 873 שיחות באורך ממוצע של כעשר דקות בין נציג ללקוח. כל ההקלטות נוצרו במיוחד עבור הפרויקט דרך שיחות VoIP ממחשבים, טלפונים וטאבלטים, עם רעשי רקע קלים מסביבות ביתיות ומקומות ציבוריים. 156 דוברים גויסו מ־14 אזורים שונים כדי לכסות מבטאים כמו בריטי, הודי, סינגפורי, דרום אפריקאי וגרסאות אמריקאיות שונות על פני 16 עולמות תוכן שירותיים.

התמלול נעשה ידנית על ידי עשרות מתמללים מקצועיים, ללא שימוש במודלים מקדימים, ועבר סבבי בדיקות איכות שבהם תוקנו מקטעים בעייתיים. השיחות לא מכילות מידע אישי מזהה והמשתתפים השתמשו בפרטים מומצאים.

המאגר מחולק לשתי תצורות שונות. הראשונה שומרת כל ערוץ שמע בנפרד עבור בדיקות זיהוי דיבור רגילות, ואילו השנייה ממזגת את שני הצדדים לקובץ שמע אחד עם תיוגי זמנים ודוברים עבור משימות דיאריזציה.

מתאים ל

  • הערכת תמלול לשיחות ארוכות

    בדיקת דיוק של מודלי ASR על שיחות שלמות של 5 עד 15 דקות הכוללות דיבור מקוטע ותיקונים עצמיים.

  • מדידת עמידות למבטאים

    השוואת שגיאות זיהוי דיבור בין 14 קבוצות מבטא שונות באנגלית, כולל מבטאים הודיים, סינגפוריים ואיריים.

  • בחינת מודלי דיאריזציה

    שימוש בתצורת השיחה הממוזגת עם תיוגי זמנים ודוברים כדי למדוד הפרדת קולות בשיחת נציג ולקוח.

איפה זה נופל

הנתונים מוגבלים לחלוטין לשפה האנגלית ואינם כוללים עברית. השיחות מבוססות על משחקי תפקידים ולא על שיחות מוקד אמיתיות עם לקוחות קצה, מה שמשפיע על אופי האינטראקציה. המפרסמים מציינים במפורש שהמאגר נועד לבדיקה והערכה בלבד ולא לאימון מודלים. ישנו חוסר איזון דמוגרפי, כאשר נשים מהוות כמעט כפול מכמות הגברים, וטווח הגילאים נוטה ברובו לצעירים מתחת לגיל 50. כמו כן, ביצועי המודלים תלויים מאוד בשיטת חיתוך השמע, ושימוש במקטעים קבועים פוגע בדיוק בצורה משמעותית.

שאלות
נפוצות

האם יש במאגר שיחות בעברית?

לא. המאגר מוקדש כולו לשפה האנגלית בלבד, עם דגש על 14 מבטאים שונים של דוברי אנגלית ברחבי העולם.

האם מותר לאמן מודל מסחרי על המאגר?

הרישיון מאפשר שימוש מסחרי תחת תנאי שיתוף זהה, אך יוצרי המאגר הגדירו אותו במפורש כבנצ'מרק להערכה וציינו שאינו מיועד לאימון מודלים. בנוסף, חובת שיתוף הנגזרות ברישיון זה עלולה לחול על תוצרי עיבוד ישירים של המידע.

איך השיחות הוקלטו והאם מדובר בלקוחות אמיתיים?

השיחות אינן שיחות אמת אלא סימולציות מבויימות בין 156 משתתפים שגויסו מראש. ההקלטות בוצעו במערכת VoIP דרך מכשירים אישיים, והדוברים קיבלו הנחיה להשתמש בשמות ובפרטי חשבון פיקטיביים לחלוטין.

מדוע יש צורך בכלי VAD מיוחד בעבודה עם הדאטהסט?

הביצועים על המאגר רגישים מאוד לאופן חיתוך השמע. חיתוך באורכים קבועים פוגע בתוצאות, ולכן היוצרים ממליצים להשתמש בכלי Silero VAD עם הגדרות ספציפיות כדי לקבל מקטעים באורך ממוצע של כ־16.5 שניות לפני הרצת המודל.

איך טוענים

טוענים את המאגר דרך Hugging Face בספליט היחיד שקיים, שהוא split="test", מאחר שאין בו חלוקת אימון. אפשר לבחור בין התצורה הרגילה לתצורת diarization. המאגר פתוח להורדה ישירה ללא צורך בהרשאת גישה מיוחדת, אך הוא כולל אלפי קבצי שמע בפורמט WAV שמגיעים לנפח של יותר מ־128 שעות, ולכן יש להיערך למקום פנוי בדיסק. השדות החשובים לניתוח הם קובץ השמע, הטקסט המתוזמן, שיוך המבטא, התחום ותפקיד הדובר.

from datasets import load_dataset

ds = load_dataset("apptek-com/apptek_callcenter_dialogues")

הרישיון

הרישיון הוא CC BY-SA 4.0. מותר להשתמש בו לצרכים מסחריים ובלבד שניתן קרדיט ליוצרים. סעיף השיתוף הזהה מחייב שאם אתם משנים את המאגר או מפיצים נגזרת שלו, עליכם לשחרר אותה תחת אותו הרישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗