GPT
S

Speech-MASSIVE

קוד פתוח

FBK-MTcc-by-nc-sa-4.02024-06-10

  • spoken language understanding
  • slot filling
  • intent classification
  • speech translation
  • speaker identification

המאגר מחבר הקלטות קוליות לתיוגי כוונות וישויות ב־12 שפות. הוא מתאים למי שבונה או בוחן מודלים להבנת דיבור ישירות מאודיו ללא שלב תמלול נפרד.

  • 1,488הורדות בחודש
  • 51לייקים

מה זה

הנתונים מבוססים על משפטים מוקלטים שנגזרו מדאטהסט הטקסט MASSIVE, כאשר ההקלטות והשיפוטים נאספו באמצעות מיקור המונים. כל רשומה מכילה קובץ שמע בקצב דגימה של 16kHz, תמלול טקסטואלי, ותיוגים מעמיקים: סיווג כוונה מתוך 60 אפשרויות, שיוך לתרחיש מתוך 18 קטגוריות, וחלוקת תגיות לפי ישויות במשפט. בנוסף, נכללים נתונים דמוגרפיים על הדוברים וציוני איכות שנתנו המשתמשים לתחביר, איות והתאמת הכוונה.

המבנה מאורגן לפי שפות יעד כמו ערבית, גרמנית, צרפתית, ספרדית, הונגרית ועוד, לצד תצורת all המאחדת את החומרים. החלוקה הפנימית כוללת סטים של אימון וולידציה, וכן פיצול קטן בשם train_115 שמיועד לבדיקות תחת תנאי מיעוט נתונים.

מתאים ל

  • הבנת דיבור מבוססת שמע

    אימון מודלים לחילוץ ישויות וכוונות ישירות מהקלטות קול ללא מעבר בטקסט כתוב.

  • הערכת ביצועים רב לשונית

    בדיקת יכולות זיהוי כוונות קוליות ב־12 שפות שונות תחת אותה מסגרת תיוג.

  • אימון במשאבים מוגבלים

    בחינת שיטות Few-Shot בסיווג דיבור בעזרת הפיצול המובנה של 115 דוגמאות.

איפה זה נופל

ההקלטות נאספו במיקור המונים ולכן סביבות ההקלטה והציוד אינם אחידים, אף שיש ציוני אימות ושיפוט במאגר. עברית אינה נכללת ברשימת 12 השפות, כך שהמאגר חסר תועלת לפיתוח מקומי ישיר. בנוסף, חלוקת הדוגמאות אינה שווה בין השפות. בערבית ובספרדית אין סט אימון מלא אלא רק ולידציה ואימון מוגבל, מה שמחייב בדיקה מדוקדקת של השפה הרלוונטית לפני תחילת עבודה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-sa-4.0 ואוסר שימוש מסחרי מכל סוג. הוא מתאים למחקר אקדמי ולהערכות פנימיות בלבד.

האם יש במאגר תמיכה בעברית?

לא. המאגר מכיל 12 שפות בלבד, בהן ערבית, גרמנית, צרפתית, ספרדית, וייטנאמית, קוריאנית ורוסית. עברית אינה חלק מהפרויקט.

כמה נפח דורשת הורדת הנתונים?

הורדת תצורת all של כלל השפות דורשת כ־23.7 גיגה בייט של קבצים מכווצים. אם בוחרים קונפיגורציה של שפה בודדת, הנפח יורד למאות מגה בייט עד גיגה בייטים בודדים בהתאם לשפה.

מדוע בחלק מהשפות חסר סט אימון מלא?

האיסוף נעשה בהיקפים שונים לכל שפה. לדוגמה, בערבית ובספרדית יש רק פיצול ולידציה ופיצול train_115 קטן, בעוד שבגרמנית וצרפתית יש מעל 11,000 דוגמאות אימון.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face לפי שם המאגר והשפה הרצויה. אין צורך באישור גישה מיוחד, אך הורדת כלל הקבצים כבדה מאוד ומגיעה לכ־23.7 גיגה בייט בתצורת all. הנתונים מאוחסנים בפורמט Parquet, כאשר השדות המרכזיים לעבודה הם audio, utt, intent_str ו־labels.

from datasets import load_dataset

ds = load_dataset("FBK-MT/Speech-MASSIVE")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות ברורה וחדה: אסור כל שימוש מסחרי בנתונים או במודלים שאומנו עליהם. אם אתם חוקרים ומפרסמים נגזרת, אתם חייבים לתת קרדיט למחברים ולהפיץ את התוצר תחת אותו רישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗