GPT
Y

yambda

קוד פתוח

yandexapache-2.02025-05-27

  • recsys
  • retrieval
  • dataset

מאגר ענק של כמעט חמישה מיליארד אינטראקציות מוזיקה עם וקטורי שמע למיליוני שירים. היתרון הגדול הוא תיוג ברור שמבדיל בין האזנה יזומה של המשתמש לבין המלצה מהאלגוריתם.

  • 2,862הורדות בחודש
  • 232לייקים

מה זה

הנתונים מציגים אינטראקציות של מיליון משתמשים מול מעל 9.39 מיליון שירים. הרשומות מחולקות לפי סוגי פעולות כמו האזנות, לייקים, דיסלייקים וביטולים שלהם, לצד קובץ מאוחד. בכל פעולה נשמרים מזהה משתמש, מזהה שיר, חותמת זמן בדידים של 5 שניות, ודגל שמציין אם הפעולה הייתה אורגנית או נבעה מפיד והמלצות של המערכת. בהאזנות נשמרים גם אורך השיר ואחוז הנגינה בפועל.

בנוסף לאינטראקציות, המאגר כולל שיכוcontext/וקטורי שמע מוכנים עבור כ־7.72 מיליון שירים, שהופקו באמצעות רשת קונבולוציה המבוססת על למידה ניגודית. המידע זמין בשלושה גדלים שונים: גרסת 50 מיליון רשומות, 500 מיליון, והגרסה המלאה של קרוב לחמישה מיליארד אירועים. אפשר להוריד את הנתונים בפורמט טבלאי שטוח או בפורמט רצפי מקובץ לפי משתמש.

מתאים ל

  • אימון מנועי המלצה

    לימוד רצפי האזנה של משתמשים עם התחשבות בהבדל בין בחירה יזומה להמלצה.

  • אחזור שירים לפי שמע

    בניית מודלי דירוג המשלבים פידבק משתמשים יחד עם וקטורי האודיו המוכנים.

  • בנצ'מרק למודלי המלצה

    הערכת ביצועים על בסיס פרוטוקול הערכה אחיד בקנה מידה של מיליארדי שורות.

איפה זה נופל

בסט הבדיקה אין משתמשים חדשים, כך שאי אפשר להעריך כאן בעיות של התחלה קרה למשתמשים, אלא רק למקצת השירים. בנוסף, חותמות הזמן אינן רציפות אלא מקובצות למרווחים של 5 שניות, ואין שום טקסט, שמות שירים או מטא-דאטה לשוני, כך שאי אפשר לחקור ז'אנרים, שפות או העדפות שוק ישראלי. שדה אחוז ההאזנה יכול לעבור 100 אחוזים במקרים של הרצה לאחור, דבר שדורש טיפול מראש בקוד.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט למוצר מסחרי?

הרישיון הרשמי הוא apache-2.0 שמאפשר שימוש מסחרי, אבל כותבי הכרטיס ציינו שהוא מיועד למחקר ומדע בלבד. לא הייתי בונה עליו מוצר בלי לקבל הבהרה משפטית לגבי הסתירה הזו.

האם יש במאגר שירים בעברית או מטא-דאטה טקסטואלי?

אין שום מידע טקסטואלי, שמות שירים, מבצעים או שפות. הנתונים כוללים רק מזהים מספריים, וקטורי שמע סטנדרטיים וזמנים, כך שלא ידוע מה אחוז השירים בעברית אם בכלל.

איך נאספו האינטראקציות?

הנתונים מבוססים על פעולות של כמיליון משתמשים ומחולקים לפעולות אורגניות מול פעולות שנוצרו מהמלצות בפיד ובפלייליסטים. השמע עובד לוקטורים באמצעות רשת קונבולוציה ייעודית.

למה אחוז ההאזנה גבוה מ־100 בחלק מהרשומות?

הנתון הזה מופיע כשמשתמש מחזיר את השיר אחורה ומאזין לחלקים שוב, כך שזמן הנגינה המצטבר עולה על האורך המקורי. הכותבים מדגישים שזה תיעוד אמיתי של התנהגות ולא תקלה.

איך טוענים

הטעינה נעשית דרך ספריית datasets באמצעות הפקודה load_dataset עם ציון המאגר, התיקייה הרצויה ושם קובץ ה־parquet, למשל מתוך גרסת 50m. הגישה חופשית ואינה דורשת אישור מוקדם. יש 75 קבצים במאגר, ומאחר שמדובר במיליארדי שורות, כדאי להתחיל מהגרסאות הקטנות יותר. שדות המפתח לסינון ועיבוד הם uid, item_id, timestamp והדגל is_organic שקובע את מקור הפעולה.

from datasets import load_dataset

ds = load_dataset("yandex/yambda")

הרישיון

המאגר מופץ ברישיון apache-2.0 שמתיר שימוש, שינוי והפצה, כולל ייחוס למקור. עם זאת, בתיאור המאגר נכתב במפורש שהוא מפורסם למטרות מדעיות ומחקר בלבד. הסתירה הזו מחייבת בדיקה משפטית זהירה אם מתכננים להשתמש בנתונים לאימון מודל מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗