GPT
L

LAION-DISCO-12M

קוד פתוח

laionapache-2.02024-10-20

  • music

יש כאן גם סקירה על LAION עצמו.

אינדקס של מעל 12 מיליון קישורים לשירי מוזיקה ביוטיוב יחד עם מטא דאטה מלא. הוא מתאים למי שבונה מודלים מוזיקליים וזקוק לעוגן מידע רחב בלי להחזיק קבצי שמע כבדים מראש.

  • 309הורדות בחודש
  • 55לייקים

מה זה

במאגר יש מטא דאטה עבור 12,648,485 שירים וסרטוני מוזיקה מיוטיוב, שמקושרים ל־250,516 אמנים שונים. הרשומות לא מכילות אודיו אלא מצביעות על קבצי המקור ברשת הציבורית. כל שורה כוללת מזהה שיר, שם יצירה, שמות אמנים ומזהים שלהם, שם ומזהה אלבום, סימון תוכן בוטה, כמות צפיות, אורך השיר וכתובת יוטיוב ישירה.

האיסוף נשען על הרחבת המתודולוגיה של DISCO-10M. במקום להסתפק ברשימת בסיס מצומצמת של 18 אמנים שהניבה כחמישה מיליון שירים, הצוות גיבש רשימת פתיחה של 45,218 אמנים מתוך מצעדי שירים מובילים לפי מדינות ופלייליסטים ז'אנריים ביוטיוב מיוזיק. משם סרקו רקורסיבית את גרף האמנים דרך המלצות המעריצים כל עוד התגלו שמות חדשים, ושלפו את כל השירים והקליפים של כל אמן.

מתאים ל

  • אימון מודלים לזיהוי שמע

    הורדת דגימות אודיו מהקישורים לפי מזהי שירים ואמנים לשם אימון מסווגים גנריים או חילוץ מאפיינים מוזיקליים.

  • בניית מערכות המלצה

    ניתוח גרף האמנים, האלבומים ומספרי הצפיות ליצירת מודלים שממליצים על רצועות דומות ומנבאים פופולריות.

  • מחקר על תרבות מוזיקלית

    בדיקת דפוסי קשרים בין 250 אלף אמנים ומיפוי שכיחות אלבומים מול שירים בודדים ברשת.

איפה זה נופל

זהו אינדקס בלבד ולא מאגר שמע. המשמעות היא שצריך להוריד את הסרטונים בפועל, וסרטונים ביוטיוב נמחקים, נחסמים גיאוגרפית או הופכים לפרטיים כל הזמן. בנוסף, שיטת האיסוף מבוססת על מצעדים והמלצות, כך שהיא נוטה להגביר מוזיקה פופולרית ומיינסטרים על פני שוליים. אין פירוט בכרטיס לגבי חלוקת השפות, כך שאי אפשר לדעת מראש כמה ייצוג יש לעברית או לז'אנרים מקומיים קטנים.

שאלות
נפוצות

האם הדאטהסט כולל קבצי מוזיקה להאזנה?

לא, אין בו קבצי אודיו כלל. המאגר הוא אינדקס המכיל מטא דאטה וקישורים ישירים לסרטונים ביוטיוב, ואת השמע צריך להוריד באופן עצמאי בהתאם לצרכים שלכם.

מה ההבדל בין המאגר הזה לבין DISCO-10M המקורי?

הפרויקט הזה שאב השראה מ־DISCO-10M אך הגדיל משמעותית את נקודת ההתחלה. במקום רשימת בסיס של 18 אמנים בלבד, כאן התחילו עם מעל 45 אלף אמנים מתוך מצעדים, מה שהביא ליותר מ־12 מיליון שירים במקום כחמישה מיליון.

האם המאגר מתאים לשימוש מסחרי?

הרישיון המדווח על קובץ המטא דאטה הוא Apache 2.0, שמתיר שימוש מסחרי בכפוף לייחוס. יחד עם זאת, הסרטונים עצמם ביוטיוב כפופים לזכויות היוצרים של בעליהם ולתנאי השימוש של האתר, וזה לא מכוסה ברישיון הקובץ.

האם יש במאגר ייצוג למוזיקה בעברית?

רשימת הבסיס נבנתה ממצעדי שירים מובילים ביוטיוב לפי מדינות, כך שייתכן שמוזיקה ישראלית נכללה בסריקה. עם זאת, אין תיעוד מסודר של שפות או מדינות ברשומות, ותצטרכו לבדוק את שמות האמנים באופן יזום כדי לדעת את היקף התוכן בעברית.

איך טוענים

הקובץ מחולק לחמישה חלקי parquet בתוך תיקיית המידע ומכיל שבעה קבצים בסך הכל. אין צורך בבקשת גישה מיוחדת, טוענים ישירות דרך כלי קריאת דאטה רגילים או בספריית הדאטהסטים. השדות הקריטיים לעבודה הם קישור היוטיוב לצורך הורדת האודיו עצמו, ומזהי האמנים, האלבומים והשירים לסינון וחלוקה לקבוצות אימון ובדיקה.

from datasets import load_dataset

ds = load_dataset("laion/LAION-DISCO-12M")

הרישיון

הרישיון המדווח הוא Apache 2.0, שמאפשר שימוש מסחרי, שינוי והפצה, ודורש שימור זכויות יוצרים וייחוס ליוצרים המקוריים. עם זאת, הרישיון הזה חל על קובץ הנתונים והטקסט בלבד. השירים והסרטונים עצמם ביוטיוב מוגנים בזכויות יוצרים של היוצרים ופלטפורמת המקור, ואימון מודל עליהם דורש בחינה משפטית של זכויות השימוש בתוכן המוזרם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗