GPT
W

WavCaps

קוד פתוח

cvsspcc-by-4.02023-04-12

מאגר שמחבר בין הקלטות קול לתיאורי טקסט באנגלית שנוצרו בעזרת ChatGPT. מתאים למי שמאמן מודלים להבנת סאונד או מחפש נתונים למשימות טקסט לשמע.

  • 9,489הורדות בחודש
  • 56לייקים

מה זה

המאגר מכיל 403,050 קטעי אודיו בליווי תיאורים טקסטואליים ומטא-דאטה. הנתונים נאספו מארבעה מקורות שונים: FreeSound עם 262,300 הקלטות, תת-הקבוצה המתויגת היטב של AudioSet עם 108,317 קטעים, ארכיון האפקטים של ה־BBC עם 31,201 קטעים, ו־SoundBible שכולל 1,232 הקלטות בלבד.

לכל מקור מופיע קובץ JSON נפרד שמכיל את התיאור המקורי, את התיאור המעובד ונתונים נוספים. האורכים של הקטעים שונים מאוד בין המקורות, מקטעים קצרים של עשר שניות בממוצע מתוך AudioSet ועד לקבצים ארוכים שמגיעים לממוצע של קרוב לשתי דקות מה־BBC. הטקסטים הם תיוג חלש שנבנה באמצעות ChatGPT על בסיס התיאורים הגולמיים.

מתאים ל

  • איחזור קול לפי טקסט

    חיפוש קטעי סאונד מתוך מאגר בעזרת תיאור מילולי באנגלית.

  • יצירת כתוביות לשמע

    אימון מודלים שמקבלים רצועת אודיו ומייצרים לה תיאור טקסטואלי אוטומטי.

  • סיווג שמע באפס דוגמאות

    זיהוי וסיווג אירועי קול שונים בלי אימון מוקדם על קטגוריות סגורות.

  • יצירת סאונד מטקסט

    בניית מודלי דיפוזיה או מחוללים שמפיקים אפקטים קוליים מתוך פרומפט.

איפה זה נופל

הטקסטים מוגבלים לשפה האנגלית בלבד, ואין כאן תמיכה בעברית או בשפות אחרות. התיאורים לא נכתבו בידי אדם אלא עובדו בעזרת מודל שפה, מה שמכניס רעש, חוסר דיוקים ותיוג חלש לתוך המערכת. בנוסף, חלוקת המקורות לא מאוזנת בעליל. רוב מוחלט של החומר נשען על FreeSound ו־AudioSet, ואילו מקורות אחרים זניחים בגודלם, מה שיוצר שונות גדולה באיכות ההקלטות ובאורך הקטעים לפני שמתחילים לרוץ עליהם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, השימוש מוגבל למחקר אקדמי בלבד. המפרסמים ציינו זאת במפורש בכרטיס, והם נשענים על פטור של חוקי זכויות היוצרים בבריטניה שאינו תקף לפיתוח מסחרי. בנוסף, המקורות עצמם כמו ה־BBC מחזיקים בזכויות יוצרים שמגבילות את התוכן.

האם יש במאגר נתונים או תיאורים בעברית?

לא, כל התיאורים הטקסטואליים נוצרו באנגלית בלבד. אם המטרה היא לאמן מודל שמגיב לשאילתות בעברית, תצטרכו לתרגם את התיאורים באופן עצמאי לפני תחילת העבודה. קובצי האודיו עצמם הם רעשי רקע ואפקטים שאינם תלויי שפה.

איך נאספו ותויגו הנתונים בפועל?

קטעי האודיו נאספו מארבעה מאגרים שונים ברשת וכללו תיאורים גולמיים ומטא-דאטה מקורי. החוקרים השתמשו ב־ChatGPT כדי לעבד ולנסח מחדש את התיאורים המקוריים לקבלת כתוביות אחידות. התוצאה היא תיוג חלש שנוצר באופן אוטומטי על בסיס הטקסט המקורי של כל קובץ.

איך טוענים

ההורדה לא מתבצעת בשורת קוד אחת דרך הספרייה הרגילה של Hugging Face אלא מחייבת פריקה ידנית. קובצי השמע נשמרים בפורמט flac ומחולקים לארכיוני zip מפוצלים תחת ספריית Zip_files. פריקת הארכיונים, במיוחד של AudioSet, עלולה להקפיץ שגיאת zip bomb במערכת ההפעלה, ולכן המפרסמים צירפו פקודת zip ייעודית לתיקון הקובץ לפני החילוץ. לצד האודיו מורידים את קובצי ה־JSON כדי לקבל את הקישור בין שמות הקבצים, התיאורים שעובדו והמטא-דאטה המקורי.

from datasets import load_dataset

ds = load_dataset("cvssp/WavCaps")

הרישיון

למרות שהכרטיס מציג CC-BY 4.0, הטקסט הרשמי של היוצרים קובע במפורש שהשימוש מותר למטרות מחקר אקדמי בלבד. כל אחד מהמקורות המקוריים כמו ה־BBC או FreeSound מחזיק בתנאי רישוי משלו, והמודלים שפורסמו נשענים על החרגת זכויות יוצרים בריטית למחקר לא מסחרי. לכן אסור להשתמש בנתונים האלה כדי לאמן מודלים שמיועדים למוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗