GPT
A

AudioSet

קוד פתוח

agkphysicscc-by-4.02023-06-14

  • audio

קטעי אודיו בני עשר שניות מיוטיוב שמתוייגים לפי קטגוריות צליל. המאגר מתאים למי שרוצה לאמן או לבחון מודלים לסיווג צלילים בלי להוריד סרטונים בעצמו.

  • 56,962הורדות בחודש
  • 107לייקים

מה זה

הנתונים כוללים קטעי קול באורך עשר שניות שנחתכו מסרטוני יוטיוב ותויגו לקטגוריות שונות לפי האונטולוגיה של AudioSet. כל רשומה מחזיקה מזהה סרטון, קובץ אודיו בפורמט FLAC, מערך ערכים מספרי, קצב דגימה, מזהי תוויות ומערך שמות התוויות לקריאת אדם באנגלית.

המאגר מחולק לשתי תצורות עבודה. התצורה המאוזנת כוללת 18683 קטעים באימון ו־17141 בבדיקה. התצורה הלא מאוזנת גדולה בהרבה ומכילה 1738657 דוגמאות אימון מול אותן 17141 דוגמאות בדיקה. הפיצול הזה מאפשר לבדוק ביצועים על סט מבחן קבוע, בין אם מאמנים על החלק המצומצם והמאוזן ובין אם לוקחים את ההיקף המלא.

מתאים ל

  • סיווג אירועי קול

    אימון מודלים לזיהוי קטגוריות שמע שונות כמו דיבור או רעשי רקע מתוך קטעים קצרים.

  • הערכת ביצועי מודל

    בדיקת דיוק והשוואת מודלים על גבי סט המבחן המונה 17141 דגימות קבועות.

  • חילוץ ייצוגי שמע

    למידת ייצוגים וקטוריים מקטעי שמע מגוונים לצורך משימות עיבוד אודיו במורד הזרם.

איפה זה נופל

ההורדה של הסרטונים התבצעה במרץ 2023, וחלק מהתוכן המקורי כבר נמחק מיוטיוב ולא קיים כאן. בסט המאוזן יש רק 18683 קטעים מתוך 22160 שהיו במקור, ובסט הבדיקה נותרו 17141 מתוך 20371. בסט הלא מאוזן ירדו 1738788 קטעים מתוך 2041789. בנוסף, כל התוויות הן באנגלית בלבד, ואין פירוט בכרטיס לגבי תהליך התיוג, הסינון או הטיות חברתיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון המדווח הוא cc-by-4.0 ולכן מבחינת המאגר עצמו מותר שימוש מסחרי עם מתן קרדיט. יחד עם זאת, קטעי הקול עצמם נאספו מיוטיוב, ולכן עליכם לוודא שהשימוש שלכם עומד בכללי השימוש של סרטוני המקור.

האם יש במאגר תוכן או תוויות בעברית?

לא. התוויות שמצורפות לרשומות מופיעות באנגלית בלבד לפי האונטולוגיה של AudioSet. שפת הדיבור בסרטונים עצמם אינה מתועדת בכרטיס המאגר.

מדוע חסרים חלק מהקטעים של AudioSet המקורי?

הקבצים הורדו מיוטיוב במרץ 2023, ובאותה נקודת זמן סרטונים רבים כבר נמחקו או הפכו לפרטיים. מסיבה זו הסט המאוזן כולל 18683 קטעים במקום 22160, ובסט הבדיקה יש 17141 במקום 20371.

מה פורמט האודיו ואיזה עיבוד מקדים נדרש?

האודיו שמור בפורמט FLAC בעומק 24 ביט. רוב הקבצים נדגמו ב־48000 הרץ אך כעשרה אחוזים נדגמו ב־44100 הרץ, כך שמומלץ לבצע המרה לקצב דגימה אחיד לפני האימון.

איך טוענים

טוענים את המאגר ישירות דרך קובצי parquet, כאשר יש 946 קבצים במאגר. הנתונים פתוחים להורדה מיידית ואין צורך בבקשת גישה מיוחדת. האודיו עצמו מגיע מקודד כ־FLAC בתוך הרשומה. השדות החשובים לעבודה הם human_labels שמציג את שמות הקטגוריות באנגלית, ו־audio שמכיל את מערך הדגימות ואת קצב הדגימה. שימו לב שרוב האודיו נדגם ב־48000 הרץ עם 24 ביט, אבל כעשרה אחוזים מהקבצים מגיעים בקצב של 44100 הרץ, ולכן צריך לבצע התאמת קצב דגימה אחיד לפני ההזנה למודל.

from datasets import load_dataset

ds = load_dataset("agkphysics/AudioSet")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של המידע, ואינו מחייב שיתוף של הנגזרות תחת אותו רישיון בדיוק. הדרישה המרכזית היא מתן קרדיט וייחוס מתאים למפרסמים ולמאמר המקורי. חובה לבדוק בנפרד את היבטי זכויות היוצרים על קטעי המקור שנלקחו מיוטיוב לפני שילוב במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗