GPT
F

FSD50k

קוד פתוח

Fhrozencc-by-4.02022-05-06

  • audio-slot-filling

מעל חמישים אלף הקלטות קול אנושיות ומתוייגות לפי היררכיה רחבה. זה המאגר שאתם צריכים כשאתם מחפשים קולות מהעולם האמיתי באיכות אחידה ולא רק דיבור רציף.

  • 11,555הורדות בחודש
  • 17לייקים

מה זה

המאגר מכיל 51,197 קטעי שמע מפלטפורמת Freesound, שמסתכמים ב־108.3 שעות. כל הקבצים מגיעים כקובצי WAV מונו לא דחוסים באיכות 16 ביט ו־44.1 קילוהרץ, באורכים שנעים בין 0.3 ל־30 שניות. התיוג נעשה ידנית על ידי בני אדם באמצעות פלטפורמת Freesound Annotator, והוא מתבסס על אוצר מילים של 200 מחלקות צליל שממופות ישירות לתת קבוצה מתוך AudioSet Ontology של גוגל.

התוכן מחולק לשתי קבוצות עיקריות, כאשר החלוקה מוודאת ששום מעלה תוכן מ־Freesound לא מופיע בשתיהן יחד. ערכת הפיתוח כוללת 40,966 קטעים באורך ממוצע של 7.1 שניות, ומחולקת מראש לאימון ואימות. ערכת ההערכה כוללת 10,231 קטעים באורך ממוצע של 9.8 שניות, ומכילה תיוג ממצה ומלא יותר עבור אוצר המילים שנבדק.

התיוגים עצמם הם ברמת הקטע כולו, ללא סימון זמנים מדויק של תחילת או סוף האירוע. בנוסף, התוויות עוברות מריחה כלפי מעלה בהיררכיה, כך שתיוג של צליל מסוים מוסיף לו אוטומטית גם את מחלקות האב שלו.

מתאים ל

  • סיווג אירועי שמע מרובי תוויות

    אימון מודלים לזיהוי מספר צלילים מקבילים ברקע, כמו נביחות כלב, צפירות ורעשי טבע שונים.

  • בנצ'מרק להערכת מודלים אקוסטיים

    שימוש בערכת ההערכה הממצה לבדיקת ביצועים של ארכיטקטורות קול מול תוצאות הבסיס שפורסמו.

  • ניתוח מטא דאטה של צלילים

    מחקר על תיוג אוטומטי והתאמה בין טקסט חופשי, תגיות משתמשים והיררכיית קולות רשמית.

איפה זה נופל

ההתפלגות של 200 המחלקות אינה שווה, ומחלקות מסוימות סובלות ממחסור חמור בנתונים ולכן אוחדו לתוך קטגוריות אב רחבות ומעורפלות. התיוג בערכת הפיתוח עלול להיות חלקי, והוא מוגדר ברמת הקטע כולו ולא ברמת המקטע הזמני המדויק. בנוסף, המאגר מתמקד בעיקר בצלילים פיזיים, צלילי חפצים, בעלי חיים ומוזיקה, ואינו מיועד לפענוח שפה דבורה. אין בו התייחסות לעברית, והאיכות האקוסטית משתנה מאוד בהתאם לציוד שבו השתמשו המשתמשים שהעלו את התוכן במקור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר כמכלול מוגדר ברישיון CC-BY-4.0, אבל כל קובץ שמע מגיע עם רישיון מקורי משלו. חלק מהקבצים נמצאים תחת CC-BY-NC שאוסר שימוש מסחרי, ולכן אימון מודל מסחרי דורש סינון מראש של כל הקבצים הלא מסחריים לפי קובצי ה־JSON המצורפים.

האם הדאטהסט כולל הקלטות דיבור בעברית?

לא. המאגר מבוסס על צלילי סביבה, חיות, חפצים ומוזיקה שנאספו מ־Freesound. למרות שיש קטגוריות של קולות אנושיים, הן מתמקדות בהברות, נשימות או קולות רקע כלליים ולא בעיבוד שפה טבעית או דיבור עברי.

מאיפה הגיעו הנתונים ואיך וידאו את האיכות שלהם?

האודיו נלקח מתוך מאגר Freesound ועבר תיוג ידני על ידי בני אדם דרך ממשק Freesound Annotator. איכות התיוג נבדקה באמצעות הצגת דוגמאות אימות למתייגים, וישנו קובץ ייעודי עם דירוגי הסכמה בין מתייגים לכל קטע.

מה ההבדל המרכזי בינו לבין AudioSet המקורי של גוגל?

בעוד ש־AudioSet מספק בעיקר קישורים לסרטוני יוטיוב שעלולים להימחק ומכילים דחיסת אודיו שונה, כאן מקבלים קובצי WAV גולמיים בגישה ישירה. בנוסף, ערכת ההערכה של FSD50K עברה תיוג ידני ממצה וקפדני של כל המחלקות.

איך טוענים

המאגר הנוכחי בהאגינג פייס הוא עותק מלא של המקור מ־Zenodo. אין צורך לבקש אישור גישה מיוחד, וטוענים אותו ישירות על ידי שכפול המאגר באמצעות Git. התיקיות מסודרות בצורה ברורה: קובצי השמע יושבים תחת תיקיית clips בחלוקה ל־dev ו־eval, וקובצי ה־CSV עם התיוגים נמצאים תחת תיקיית labels. קובצי המטא-דאטה הנוספים מספקים מיפוי קריטי של שמות הקבצים למזהי Freebase, וכן קובצי JSON שמכילים פרטים מלאים על היוצרים והרישיונות של כל קטע.

from datasets import load_dataset

ds = load_dataset("Fhrozen/FSD50k")

הרישיון

המאגר כמכלול מופץ תחת רישיון CC-BY-4.0, שדורש מתן קרדיט ליוצרים המקוריים. עם זאת, כל קטע שמע בודד שומר על הרישיון המקורי שקבע מי שהעלה אותו ל־Freesound. חלק מהקבצים שוחררו תחת רישיונות CC0 או CC-BY, אך קיימים קבצים תחת CC-BY-NC שאוסרים שימוש מסחרי, ורישיונות מסוג CC Sampling+. אם אתם מתכננים לאמן מודל למוצר מסחרי, אתם חייבים לסנן את הקבצים לפי קובצי המידע dev_clips_info_FSD50K.json ו־eval_clips_info_FSD50K.json כדי להסיר קטעים שאסורים בשימוש מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗