GPT
V

VGGSound

קוד פתוח

Loieרישיון לא דווח2023-02-17

מאגר וידאו ואודיו שמכיל מעל 200,000 קטעים באורך עשר שניות מיוטיוב, עם התאמה מלאה בין מה שרואים למה ששומעים. אם אתם צריכים לאמן סיווג קולות בסביבה רועשת, זה בדיוק המקום.

  • 3,547הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל יותר מ־550 שעות של קטעי וידאו ואודיו קצרים באורך עשר שניות כל אחד, שנחתכו ישירות מסרטונים שהועלו ליוטיוב. המטרה כאן היא התאמה חזותית וקולית, כלומר מקור הרעש מופיע באופן ברור בתוך התמונה עצמה ולא מגיע מפס קול מנותק. ההקלטות נלקחו מהעולם האמיתי, כך שהן מכילות סביבות אקוסטיות מורכבות ומגוון רחב של רעשי רקע שמאתגרים מודלים של סיווג.

התוכן מחולק ליותר מ־310 קטגוריות שונות של צלילים. בתוך המאגר תמצאו קובץ מטא-דאטה בשם vggsound.csv שמפרט עבור כל רשומה את מזהה הסרטון ביוטיוב, חותמת זמן בשניות לתחילת הקטע, התווית המתאימה וחלוקה מובנית לסט אימון ולסט בדיקה.

מתאים ל

  • אימון סיווג שמע

    זיהוי וסיווג קטעי קול מתוך מעל 310 קטגוריות אקוסטיות שונות בתנאי רעש מהעולם האמיתי.

  • מחקר אודיו ויזואלי

    הצלבת מידע בין תמונה לקול כאשר מקור הרעש נראה בבירור בתוך הווידאו.

  • בדיקת עמידות מודלים

    הערכת ביצועים של מודלי שמע על הקלטות ביתיות וסביבות אקוסטיות לא מושלמות.

איפה זה נופל

כל החומר נשען כולו על יוטיוב ועל סרטונים שצולמו בתנאי שטח, מה שאומר שיש רעשי רקע כבדים ואיכות הקלטה לא אחידה. אין פירוט לגבי שפות או התפלגות גאוגרפית, אך סביר להניח שרוב התוכן מוטה לתרבות מערבית ודוברי אנגלית, כך שאין כאן התאמה לשוק המקומי או לעברית. אם תרצו להשתמש בקישורי יוטיוב המקוריים במקום בקבצים שמועלים כאן, קחו בחשבון שסרטונים נמחקים ונעלמים מהרשת עם הזמן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הכרטיס מציין שהשימוש מותר למטרות מסחריות תחת רישיון CC-BY 4.0, בכפוף לציטוט החוקרים. יחד עם זאת, זכויות היוצרים על הסרטונים שייכות ליוצרי התוכן ביוטיוב, ושדה הרישיון בראש העמוד לא מולא. אם אתם בונים מוצר רווחי, שווה לבדוק את נוסח הרישיון המקורי באתר הפרויקט באוקספורד.

איך הנתונים נאספו ונחתכו?

החומרים נאספו מתוך סרטוני יוטיוב ונחתכו למקטעים מדויקים של עשר שניות. החוקרים דאגו לוודא שהצליל הנשמע תואם למה שמופיע פיזית בתוך הווידאו, ולא נובע ממוזיקת רקע או עריכה חיצונית.

האם יש במאגר תוכן בעברית?

אין התייחסות ספציפית לשפה בכרטיס המאגר, והוא מתמקד בקולות וברעשים סביבתיים ולא בדיבור. מכיוון שהמקור הוא יוטיוב כללי, רוב התוכן אינו ישראלי ואינו מכיל אלמנטים מקומיים.

איך טוענים

הנתונים מחולקים למספר קובצי ארכיון דחוסים בסיומת tar.gz יחד עם קובץ הטבלה vggsound.csv. אין כאן תהליך של בקשת גישה או אישור מיוחד, מורידים את הקבצים ישירות מהמאגר. בקובץ ה־CSV העמודות הרלוונטיות הן מזהה הסרטון, נקודת ההתחלה בשניות, סיווג הקול והשיוך לאימון או בדיקה. תצטרכו לפרוק את הארכיונים ולקשר את המקטעים לשורות בטבלה כדי להתחיל לעבוד.

from datasets import load_dataset

ds = load_dataset("Loie/VGGSound")

הרישיון

לפי כרטיס המאגר, הנתונים ניתנים להורדה לצרכים מסחריים ומחקריים תחת רישיון Creative Commons Attribution 4.0 International, הדורש מתן קרדיט ליוצרים. זכויות היוצרים על הסרטונים עצמם נשארות אצל הבעלים המקוריים שהעלו אותם ליוטיוב. עם זאת, בפרטי הדף בהאגינג פייס הרישיון לא סומן רשמית, ולכן כדאי לעיין בקובץ הרישיון החיצוני המקושר לפני שילוב במודל מסחרי.

הרישיון המלא ב־Hugging Face ↗