GPT
E

e-commerce-customersupport-english-audio

קוד פתוח

HumynLabscc-by-4.02025-07-28

  • speech
  • emotional-speech
  • audio-recognition
  • ai-research
  • voice-analysis

המאגר מכיל הקלטות של דוברים מקריאים משפט בודד של תלונת לקוח באנגלית. הוא מתאים בעיקר לבדיקת זיהוי דיבור במבטא הודי או סיווג רגשות בסיסי בשיחות תמיכה.

  • 116הורדות בחודש
  • 431לייקים

מה זה

מדובר במאגר קטן מאוד של הקלטות קול, שבו כל המשתתפים מקריאים בדיוק את אותו הטקסט באנגלית. המשפט עוסק בהזמנה מחנות מקוונת שלא הגיעה בזמן, ומבטא דאגה שהמשלוח אבד יחד עם בקשה לקבלת עדכון. לפי שמות הקבצים, הדוברים הם בעלי שמות דרום אסייתיים, והכרטיס מכוון במפורש לבחינת מבטא הודי.

במאגר מופיעים 22 קבצי שמע בפורמט WAV, כאשר שמות הקבצים כוללים שמות של מקליטים ותאריכים מיולי 2025. הכרטיס מציין שההיקף הכולל נמוך מאלף רשומות. אין כאן חלוקה מובנית לחלקי אימון, בדיקה ותיקוף, ואין פירוט על ציוד ההקלטה, סביבת הדגימה או תהליך סינון ובקרת איכות כלשהו שנעשה לקבצים לפני הפרסום.

מתאים ל

  • בדיקת זיהוי דיבור במבטא

    הערכת עמידות של מודלי שמע למבטא הודי על משפט שירות לקוחות קבוע.

  • מחקר ראשוני בסיווג רגש

    ניתוח שינויי אינטונציה וטון של דוברים שונים המקריאים את אותו הטקסט.

  • בדיקות תוכנה לעיבוד שמע

    שימוש בקבצי קול קלים כדי לוודא שצינור הקליטה של קבצי WAV עובד.

איפה זה נופל

זה לא מאגר שמתאים לאימון מודל פרודקשן. יש בו פחות מאלף דגימות, ובפועל יש רק 22 קבצים בעמוד, שכולם מקריאים את אותו המשפט בדיוק. המפרסמים מודים שהמאגר אינו מייצג את המגוון הלשוני בהודו ושרגשות הם עניין סובייקטיבי. אין כאן עברית כלל, אין מגוון של תרחישי שירות, והאיכות משתנה בין הקלטות שונות.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט נאות ליוצרים, HumynLabs, כפי שמוגדר ברישיון.

האם הדאטהסט כולל עברית?

לא. כל ההקלטות במאגר הן באנגלית בלבד, ומתמקדות בדוברים בעלי מבטא הודי שמקריאים תלונה על משלוח.

כמה נתונים יש בפועל במאגר?

הכרטיס מגדיר את הגודל כנמוך מאלף רשומות, ובמאגר עצמו מופיעים 22 קבצי שמע. זהו נפח זעיר שמתאים לבדיקות היתכנות מקומיות ולא לאימון רשתות עמוקות.

מה מקור ההקלטות ואיך אספו אותן?

הכרטיס אינו מפרט את שיטת הגיוס או התגמול. מהקבצים עולה שמדובר באנשים שהקליטו משפט תסריט יחיד ביולי 2025, ככל הנראה באמצעות מכשירים אישיים.

איך טוענים

אתם מורידים את הקבצים ישירות מהמאגר של HumynLabs ללא צורך בהרשמה מיוחדת או אישור גישה. מדובר ב־22 קבצי WAV ששוקלים מעט מאוד ונטענים ישירות לקוד. בגלל שאין קובץ מטא-דאטה מסודר עם תיוגי רגשות, תצטרכו לעבור על הקבצים בעצמכם כדי לחלץ את הטקסט או לסווג את הטון.

from datasets import load_dataset

ds = load_dataset("HumynLabs/e-commerce-customersupport-english-audio")

הרישיון

הרישיון הוא cc-by-4.0. מותר להשתמש בקבצים למטרות מסחריות, לשנות אותם ולשלב אותם במודלים, בתנאי שנותנים קרדיט ברור ליוצרים. אין חובה לשתף מודלים שתאמנו תחת אותו הרישיון, אך יש לוודא שהייחוס נשמר במוצר הסופי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗