GPT
S

spotify-tracks-dataset

קוד פתוח

maharshipandyabsd2023-06-14

  • music
  • art

מאגר נתונים טבלאי של רצועות מספוטיפיי המכיל מאפייני שמע כמותיים ומדדי פופולריות על פני 125 ז'אנרים. הוא מיועד למי שרוצה לאמן מודלים של סיווג מוזיקלי, רגרסיה והמלצות בלי להתעסק עם קבצי אודיו.

  • 2,906הורדות בחודש
  • 136לייקים

מה זה

המאגר כולל בין מאה אלף למיליון שורות, כשכל רשומה מייצגת שיר ומכילה מזהה ייחודי, שמות האמנים, האלבום ושם הרצועה, לצד תיוג ז'אנר מתוך 125 קטגוריות. הנתונים נאספו ישירות דרך ה־API של ספוטיפיי באמצעות פייתון, ועברו ניקוי לפני הפרסום.

עיקר הערך כאן נמצא במאפייני האודיו המחושבים של ספוטיפיי. לכל שיר מוצמדים ערכים רציפים ומספריים כמו מדד קצביות ורקידות, אנרגיה, אקוסטיות, חיוביות, עוצמת קול בדציבלים, קצב בדקות, סולם ומשקל מוזיקלי. לצדם מופיעים משתנים בוליאניים כמו תוכן בוטה, ומדד פופולריות פנימי שנע בין אפס למאה.

מתאים ל

  • סיווג ז'אנר מוזיקלי

    אימון מודל טבלאי לחיזוי הז'אנר מתוך 125 הקטגוריות על בסיס שילוב מאפייני האודיו המספריים.

  • מערכת המלצות תוכן

    בניית מנוע למציאת שירים דומים לפי מרחב התכונות של קצביות, אנרגיה ואקוסטיות.

  • חיזוי פופולריות

    ניתוח רגרסיה שמנסה לאמוד את ציון הפופולריות של שיר לפי האורך והתכונות המוזיקליות שלו.

איפה זה נופל

הקובץ אינו מכיל אודיו גולמי אלא רק תכונות מחושבות של ספוטיפיי, כך שאי אפשר לחלץ ממנו מאפיינים עצמאיים. שפת הנתונים מוגדרת כאנגלית בלבד, ואין ייצוג מכוון של מוזיקה ישראלית או מקומית. מדד הפופולריות משקף אלגוריתם פנימי שתלוי בהשמעות סביב מועד איסוף המידע באמצע 2023, ולכן הוא מייצג צילום מצב נקודתי ומאבד דיוק לאורך זמן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא BSD. הרישיון הזה מתיר שימוש מסחרי ואינו כופה קוד פתוח על המוצר הסופי. כל מה שצריך הוא לשמר את הצהרת זכויות היוצרים המקורית ברישיונות התוכנה.

האם המאגר כולל מוזיקה בעברית?

המאגר מוגדר כבעל שפה אנגלית בלבד ומבוסס על חלוקה ל־125 ז'אנרים גלובליים. ייתכן שמופיעים בו שירים בודדים של אמנים ישראלים שהגיעו לקטלוג הכללי, אך אין בו פילוח ייעודי לעברית או למוזיקה מקומית.

האם המאגר מכיל קבצי קול להאזנה?

לא, המאגר לא כולל קבצי MP3, WAV או דגימות שמע. מדובר בקובץ טבלאי מסוג CSV המכיל רק מטא-דאטה ומאפיינים מספריים שמנוע האודיו של ספוטיפיי חישב מראש.

מאיפה הנתונים הגיעו ואיך הם נאספו?

הנתונים נשלפו ישירות באמצעות ממשק ה־Web API הרשמי של ספוטיפיי בעזרת סקריפטים של פייתון. היוצר ביצע ניקוי של המידע וסידר אותו לפי רצועות והז'אנרים המשויכים אליהן.

איך טוענים

הנתונים מגיעים בקובץ CSV יחיד בשם dataset.csv, ללא צורך בהרשאות מיוחדות, מפתחות או אישור גישה מראש. אפשר לטעון אותו מיידית לתוך פנדס או ספריות מקבילות. שימו לב שעמודת האמנים מפרידה שמות מרובים באמצעות נקודה פסיק, וערכי מפתח מסומנים בספרות של סולמות מוזיקליים, כך שחלק מהעמודות דורשות פענוח ועיבוד מקדים לפני הכנסה למודל.

from datasets import load_dataset

ds = load_dataset("maharshipandya/spotify-tracks-dataset")

הרישיון

המאגר פורסם תחת רישיון BSD פתוח ומתירני, שמאפשר שימוש מסחרי, שינוי והפצה, בכפוף לשמירה על הודעת זכויות היוצרים. הרישיון לא מחייב שיתוף באותם תנאים, ולכן אין מניעה חוקית לאמן עליו מודלים פנימיים או מסחריים.

הרישיון המלא ב־Hugging Face ↗