GPT
V

Voices-in-the-Wild-2M

קוד פתוח

zhifeixieapache-2.02026-05-18

  • audio
  • speech
  • asr
  • robustness
  • noisy-speech

המאגר מרכז קרוב ל־646 אלף דגימות דיבור שמדמות הפרעות שמע קשות מהעולם האמיתי. הוא מיועד למי שרוצה לבחון או לאמן מודלי תמלול שלא יקרסו כשיש רעש, הדהוד או קטיעות בשידור.

  • 3,522הורדות בחודש
  • 50לייקים

מה זה

המאגר כולל 645,925 דגימות שמיועדות למשימות זיהוי דיבור אוטומטי, ומחולק ל־54 קטגוריות משנה ותרחישים מורכבים. הוא מתמקד בשבע תופעות אקוסטיות מוגדרות: רעשי רקע, דיבור ממרחק, חסימות פיזיות, הדהוד והד, פגמי הקלטה, עיוותים אלקטרוניים ונפילות תקשורת. המטרה המוצהרת של הפרויקט היא לפתור בעיות שבהן מודלים מדלגים על מילים או מייצרים הזיות כשהאודיו משובש.

כל רשומה מכילה את נתיב הקובץ, מזהה ייחודי, אינדקס מספרי, שאלת הנחיה לתמלול והתמלול הנכון עצמו בשדות טקסט ייעודיים. בנוסף תמצאו שם שדה שמציין את תנאי השמע הספציפי של ההקלטה, ומקום ריק שמיועד לשמירת הפלט של המודל שלכם בזמן הערכה. הנתונים מאורגנים בקובצי פרקט ומקושרים למסגרת העבודה של מחקר מגה איי אס אר.

מתאים ל

  • בדיקת חוסן למודלי שמע

    הרצת הערכות ביצועים על 54 תרחישי הפרעה כדי לגלות מתי מודל מתחיל להזות או להשמיט מילים.

  • אימון תמלול בתנאי שטח

    שיפור היכולת של מודלי דיבור להתמודד עם רעשי רקע, קטיעות שידור ועיוותים אלקטרוניים.

  • השוואת עמידות בין מודלים

    שימוש בתרחישים האקוסטיים המוגדרים כבנצ'מרק אחיד להשוואה בין מנועי זיהוי דיבור שונים.

איפה זה נופל

המאגר מוגבל לשתי שפות בלבד, אנגלית וסינית, ואין בו שום תמיכה בעברית. הכרטיס אינו מפרט את מקורות האודיו המקוריים או מאפיינים דמוגרפיים כמו מבטאים, גיל הדוברים ומגדר, אלא מתמקד רק בסימולציות אקוסטיות של עיוותים. אם אתם בונים מוצר לשוק המקומי או שאתם צריכים דוברי שפות אחרות, החומר הזה לא יספק לכם מענה ישיר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון שמלווה את הפרויקט הוא אפאצ'י 2.0 המאפשר שימוש מסחרי חופשי. עליכם רק לציין את הקרדיט ליוצרים המקוריים ולצרף עותק של הרישיון. אין שום דרישה לחשוף את קוד המקור של המוצר שלכם או לשחרר את המודל המאומן.

האם המאגר כולל עברית?

לא, הדאטהסט כולל אך ורק דגימות באנגלית ובסינית. אין בו הקלטות בשפות נוספות ואין בו שום נתונים בעברית. לצורך אימון מודלים מקומיים תצטרכו לחפש מקורות נתונים אחרים או לבצע סימולציות דומות על אודיו עברי.

איך נאספו ונוצרו הנתונים הללו?

המאגר נוצר כחלק ממחקר Mega-ASR שנועד להרחיב סימולציות אקוסטיות של העולם האמיתי. הוא מבוסס על שבע תופעות צליל קלאסיות כמו הדהוד, רעש, דיבור מרחוק ונפילות שידור, ששולבו ל־54 תרחישים פיזיקליים מורכבים. הכרטיס אינו מפרט מעבר לכך את מאגרי הבסיס המקוריים שמהם נלקחו קולות הדיבור.

באיזה פורמט המידע מגיע וכמה קבצים יש בו?

הנתונים מחולקים למאות קובצי פרקט, עם 857 קבצים בסך הכל במאגר. כל קובץ מרכז חלק מתרחישי העיוות השונים ומכיל את נתיבי השמע והתמלולים. הטעינה נעשית בצורה ישירה דרך הספרייה הייעודית בפייתון ללא צורך בהורדה ידנית מראש של כל הקבצים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס הרגילה בפייתון, והגישה אליו פתוחה לחלוטין ללא צורך באישור מקדים. הוא מחולק למאות קובצי פרקט, למשל קבצים ייעודיים לעיוותים אלקטרוניים, כך שההורדה דורשת חיבור יציב ונפח אחסון פנוי. בקוד צריך להמיר את עמודת השמע לסוג אודיו בעזרת הספרייה כדי לגשת לצליל עצמו, כאשר השדות שמעניינים אתכם בפועל הם קובץ השמע, שיוך התרחיש והתמלול המדויק שמופיע תחת אנר או טקסט.

from datasets import load_dataset

ds = load_dataset("zhifeixie/Voices-in-the-Wild-2M")

הרישיון

הרישיון הוא אפאצ'י 2.0. מותר להשתמש בדאטהסט למטרות מסחריות ומחקריות, לשנות אותו ולשלב אותו במערכות אחרות. התנאי המרכזי הוא מתן קרדיט מתאים למחברים ושמירה על הודעות הרישיון והזכויות המקוריות. המודלים שתאמנו על הבסיס הזה אינם מחויבים להיפתח תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗