GPT
C

CLAP_freesound

קוד פתוח

Merantiרישיון לא דווח2023-06-02

  • audio
  • text
  • contrastive learning

המאגר מרכז מאות אלפי הקלטות מפריסאונד עם תיאורים טקסטואליים באנגלית. הוא מיועד למי שמאמן מודלים לחיבור בין שמע לטקסט וצריך נפח נתונים גדול עם הפרדה מסודרת ממאגרי בדיקה מוכרים.

  • 11,021הורדות בחודש
  • 33לייקים

מה זה

המאגר מכיל קטעי שמע שמקורם באתר פריסאונד, כחלק מיוזמת LAION לאיסוף נתוני שמע וטקסט בהיקף נרחב. לכל הקלטת אודיו מוצמדים בין תיאור אחד לשניים בשפה האנגלית, לצד מטא-דאטה הכולל את מזהה ההקלטה המקורי, שם המשתמש שהעלה אותה, קישור לעמוד המקור, ורישיון השימוש הספציפי שנקבע לה.

התוכן מחולק לשתי גרסאות עיקריות. הגרסה המלאה כוללת 515,581 דגימות באורך מצטבר של כ־3,033 שעות. הגרסה השנייה, שמכילה 460,801 דגימות באורך כולל של כ־2,817 שעות, נוצרה על ידי סינון והסרה מכוונת של דגימות המופיעות במאגרי מבחן פופולריים בתחום, כולל ESC50, FSD50K, Urbansound8K ו־Clotho. הסינון הזה מאפשר לבצע בדיקות ואימות על המאגרים האלה מבלי להסתכן בזליגת מידע מאימון למבחן.

מתאים ל

  • אימון מודלי שמע וטקסט

    התאמת מודלים כמו CLAP להבנת הקשר בין תיאור מילולי לצלילים שונים.

  • סיווג אודיו רחב

    בניית מערכות לזיהוי קטגוריות צליל ורעשים סביבתיים מגוונים.

  • אימון ללא זליגת מידע

    שימוש בגרסה המסוננת כדי לאמן מודל ולהעריך אותו בצורה נקייה על FSD50K או ESC50.

איפה זה נופל

כל התיאורים במאגר נכתבו באנגלית, כך שאין כאן ייצוג לעברית או לשפות אחרות. הנתונים מבוססים על תוכן גולשים מפריסאונד עד נובמבר 2022, מה שמביא איתו איכות הקלטה לא אחידה, תיאורים קצרים מאוד או חלקיים, ורעשי רקע משתנים. בנוסף, ערבוב הרישיונות הפנימיים מחייב זהירות רבה לפני שימוש בתוצרים, משום שחלק מהקבצים כוללים הגבלות שאינן מתאימות לכל צורך.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

התנאים שפורסמו קובעים שההורדה היא למטרות מחקר בלבד. בנוסף, עשרות אלפי קבצים בפנים מוגדרים ברישיונות שאוסרים שימוש מסחרי. לצורך שימוש מסחרי נדרשת פנייה ישירה בדוא"ל אל Frederic Font Corbera.

כמה שעות שמע יש במאגר?

הגרסה המלאה כוללת כ־3,033 שעות שמע על פני 515,581 דגימות. הגרסה שממנה הוסרו החפיפות למאגרים אחרים מכילה כ־2,817 שעות ו־460,801 דגימות.

האם הנתונים כוללים טקסט בעברית?

לא, כל התיאורים במאגר הם באנגלית בלבד. אם המטרה שלכם היא להבין פקודות או תיאורים קוליים בעברית, המאגר הזה לא מספק את המענה.

מה ההבדל בין שתי הגרסאות שנמצאות במאגר?

הגרסה המלאה כוללת את כל קטעי פריסאונד שנאספו. הגרסה השנייה מסירה קטעים שכבר מופיעים במאגרי הערכה נפוצים כמו ESC50 ו־Clotho, כדי שתוכלו לבחון את המודל שלכם על מבחנים מקובלים בלי להטות את התוצאות.

איך טוענים

הקבצים מחולקים ל־1,913 ארכיוני tar בתיקיות שונות לפי החלוקה שבחרתם, כגון freesound או freesound_no_overlap. קובצי השמע הפנימיים הם בפורמט flac, ולצידם מסופק קובץ csv המכיל את כל נתוני המטא-דאטה, כולל שמות הקבצים, התיאורים והרישיונות. אין צורך באישור גישה מיוחד כדי להוריד את המאגר מהאתר, אך בשל כמות הארכיונים והיקף השעות, מומלץ לעבוד עם סקריפט הורדה ייעודי ולוודא שיש לכם מספיק שטח אחסון פנוי לקבצי ה־tar ולחילוץ השמע.

from datasets import load_dataset

ds = load_dataset("Meranti/CLAP_freesound")

הרישיון

למאגר עצמו לא הוגדר רישיון רשמי אחד, אך בעמוד נקבע תנאי שימוש מפורש שלפיו ההורדה מותרת למטרות מחקר בלבד. בפועל, כל קטע שמע מחזיק ברישיון Creative Commons מקורי משלו, החל מנחלת הכלל ועד רישיונות האוסרים שימוש מסחרי או דורשים ייחוס. כדי להשתמש בקטעים למטרות מסחריות, היוצרים מפנים ליצירת קשר ישיר בדוא"ל עם פרדריק פונט קורברה, כך שלא ניתן לשחרר מוצר מסחרי על בסיס המאגר הזה כפי שהוא.

הרישיון המלא ב־Hugging Face ↗