GPT
W

WSC-Train

קוד פתוח

ASLP-labapache-2.02025-09-05

עשרת אלפים שעות הקלטה בדיאלקט סצ'ואני עם תיוגים מפורטים. הוא מיועד למי שמפתח זיהוי דיבור לניבים סיניים ספציפיים וצריך כיסוי רחב מעולמות תוכן מגוונים.

  • 1,630הורדות בחודש
  • 159לייקים

מה זה

המאגר מכיל נתוני דיבור מוקלטים בהיקף של עשרת אלפים שעות של ניב צ'ואן-יו (סצ'ואן). התכנים מגיעים מעשרה תחומים שונים באינטרנט, ביניהם סרטונים קצרים, שידורים חיים, בידור, סרטים דוקומנטריים, ספרי שמע, דרמות, ראיונות וחדשות.

כל רשומה במטא-דאטה מייצגת מקטע אודיו ומכילה מזהה ייחודי, שם קובץ, תמלול טקסטואלי, ציון ביטחון של התמלול שנוצר משילוב שלושה מנועי זיהוי דיבור, וציון איכות קול. בנוסף, ישנם נתוני דובר כמו מגדר, קבוצת גיל ורגש, יחד עם חלוקה לתחום תוכן, אזור גאוגרפי, וחותמות זמן מדויקות לתחילת וסיום המקטע ברמת התו.

מתאים ל

  • אימון מודלי זיהוי דיבור

    פיתוח מנועי זיהוי קולי לדיאלקט סצ'ואני עבור תכני מדיה מגוונים.

  • זיהוי מאפייני דובר

    אימון מסווגים לגיל, מגדר או רגש מתוך דיבור טבעי ולא מבוים.

  • מחקר בלשני על ניבים

    ניתוח אקוסטי ופונטי של ניב צ'ואן-יו בהשוואה למנדרינית תקנית.

איפה זה נופל

המאגר מתמקד כולו בדיאלקט סצ'ואני ואינו כולל עברית או שפות מערביות. התמלול אינו ידני אלא מבוסס על שילוב של שלושה מודלי זיהוי דיבור, מה שאומר שיש שגיאות מובנות בטקסט, בעיקר בקטעים עם ציון ביטחון נמוך. איכות ההקלטות אינה אחידה כי הן נאספו מתוכן מקוון חופשי כמו שידורים חיים וסרטונים קצרים, ולא מהקלטות אולפן נקיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי ואימון מודלים למוצרים סגורים, בכפוף לשמירה על תנאי הייחוס של הרישיון.

האם יש במאגר נתונים בעברית?

לא. המאגר מכיל אך ורק הקלטות בדיאלקט הסיני סצ'ואן (צ'ואן-יו) ותמלול בסינית.

איך נאספו התמלולים והאם הם מדויקים?

התמלולים נוצרו אוטומטית משילוב של שלושה מנועי תמלול שונים ולא באמצעות תמלול ידני. לכל מקטע מוצמד ציון ביטחון כדי לאפשר סינון טקסטים שגויים.

האם כל קובצי השמע זמינים ישירות להורדה?

במאגר מופיע קובץ zip ומטא-דאטה עם קישורים למקורות. עבור אודיו מעובד ומוכן מראש, החוקרים מציינים שיש לפנות אליהם ישירות במייל או דרך ויצ'ט.

איך טוענים

המאגר כולל קובץ מטא-דאטה בפורמט jsonl וקובץ ארכיון בשם WenetSpeech-Chuan.zip. הגישה חופשית להורדה ללא טופס אישור, אך כדי לקבל נתוני שמע שעברו עיבוד מוקדם מלא, החוקרים מפנים ליצירת קשר במייל או הצטרפות לקבוצת ויצ'ט. ברירת המחדל לעבודה עצמאית דורשת שימוש בקישורי המקור שבמטא-דאטה וחיתוך האודיו לפי חותמות הזמן המצורפות.

from datasets import load_dataset

ds = load_dataset("ASLP-lab/WSC-Train")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של המידע, וכן אימון מודלים מסחריים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי. אין חובה לשתף את המודל המאומן או עבודות נגזרות תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗