GPT
M

Multitask-National-Speech-Corpus-v1

קוד פתוח

MERaLiONרישיון לא דווח2024-11-28

המאגר מרכז הקלטות דיבור שמכוונות ספציפית למבטא סינגפורי, מונחים מקומיים והחלפת שפות. הוא נבנה עבור משימות תמלול, מענה קולי לשאלות וסיכום שיחות שלא מסתדרים טוב עם אנגלית מערבית סטנדרטית.

  • 37,733הורדות בחודש
  • 22לייקים

מה זה

הנתונים מבוססים על קורפוס הדיבור הלאומי של רשות IMDA בסינגפור, ועברו הרחבה ותיוג למספר משימות שונות של הבנת דיבור. המאגר מכיל אלפי קובצי parquet שמחולקים לפי סוגי המשימות, ומיועד להתמודד עם שפת הדיבור המקומית, כולל תופעות של עירוב שפות וסלנג ייחודי לאזור.

בפנים תמצאו משימות של זיהוי דיבור אוטומטי (ASR), מענה קולי על שאלות (SQA), סיכום שיחות מדוברות (SDS), ושאלות על מאפיינים פאראלינגוויסטיים (PQA). מבנה הקבצים מפוצל לספריות נפרדות עבור אימון ומבחן, כמו ASR-PART1-Train שמכיל מאות קבצים נפרדים, אך הכרטיס אינו מפרט את שיטת הסינון או כמות השעות המדויקת.

מתאים ל

  • זיהוי דיבור במבטא סינגפורי

    אימון ובדיקה של מנועי ASR מול אנגלית מקומית ומשפטים שמשלבים סלנג סינגפורי.

  • מענה קולי על שאלות

    פיתוח מודלים של SQA ו־PQA שמנתחים שאלות ישירות מתוך אודיו ומזהים מאפייני דיבור.

  • סיכום שיחות מדוברות

    הערכת יכולת המודל לייצר סיכומים טקסטואליים מתוך שיחות קוליות מורכבות במשימת SDS.

איפה זה נופל

ההתמקדות היא כמעט בלעדית באנגלית סינגפורית, במבטא המקומי ובעירוב שפות ספציפי לאזור. אין כאן מילה אחת בעברית, והנתונים לא יעזרו למי שמאמן מודל לקהל ישראלי או למבטאים מערביים רגילים. מעבר לכך, הדף כמעט לא מספק תיעוד על אופן איסוף ההקלטות, אורך הקטעים או פרופיל הדוברים, כך שקשה לדעת מראש אילו הטיות מסתתרות בחומר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. הרישיון בדף המאגר מוגדר כלא דווח, ולכן אין שום מסמך שמקנה זכויות שימוש מסחריות או מחקריות. שימוש במודל שאומן עליו עלול לחשוף אתכם לסיכונים משפטיים.

האם המאגר כולל הקלטות בעברית?

לא, אין בו עברית. כל הנתונים מגיעים מקורפוס לאומי של סינגפור ומכוונים לאנגלית מקומית, מונחים סינגפוריים ועירוב שפות אופייני לאזור בלבד.

כמה קבצים יש בפנים ואיך מורידים אותם?

המאגר מורכב מ־6,149 קבצים, רובם קובצי parquet מפוצלים. כדי לא להוריד את כל החבילה בבת אחת, טוענים רק את המשימה הרלוונטית בעזרת הפקודה load_dataset עם ציון תיקיית היעד, למשל ASR-PART1-Train.

מאיפה הנתונים הגיעו?

הבסיס נלקח מפרויקט NSC של רשות IMDA בסינגפור. יוצרי המאגר הנוכחי עיבדו את החומרים ותייגו אותם מחדש למשימות מגוונות של הבנת שפה מדוברת.

איך טוענים

טוענים את הנתונים דרך ספריית datasets של Hugging Face בפייתון, אך חובה להגדיר את תת התיקייה הרצויה בעזרת הפרמטר data_dir, לדוגמה ASR-PART1-Train. המאגר כולל 6,149 קבצים, כך שהורדה מלאה ללא הגדרה ספציפית תיקח זמן ותדרוש נפח אחסון משמעותי. לא נדרש אישור גישה מוקדם כדי להוריד את הקבצים, והפורמט המרכזי הוא parquet.

from datasets import load_dataset

ds = load_dataset("MERaLiON/Multitask-National-Speech-Corpus-v1")

הרישיון

היוצרים לא דיווחו על רישיון שימוש במאגר. מבחינה משפטית, זה אומר שאין לכם שום הרשאה מפורשת להשתמש במידע, לא למחקר ובוודאי שלא לפיתוח מוצר מסחרי. אימון מודל על בסיס נתונים ללא רישיון מוגדר חושף אתכם לתביעות של בעלי זכויות היוצרים המקוריים, במיוחד כשמדובר בחומר שמקורו בגוף ממשלתי זר.

הרישיון המלא ב־Hugging Face ↗