GPT
M

MERT-v1-330M

קוד פתוח

m-a-pcc-by-nc-4.02023-03-17

  • transformers
  • pytorch
  • mert_model
  • feature-extraction
  • music

מודל פתוח להבנת מוזיקה שחולץ ייצוגים מורכבים מקטעי אודיו. הוא נבנה עבור מפתחים שצריכים לסווג מוזיקה או לנתח אותה ברמה גבוהה של דיוק.

  • 4.9 GBמשקל הקבצים
  • 148,146הורדות בחודש
  • 96לייקים
  • 24שכבות

מה זה

הוא אומן על 160 אלף שעות של מוזיקה, שזה פי 160 מדגמים מוקדמים יותר של אותם מפתחים, בקצב דגימה של 24 קילוהרץ. במקום לעבוד על דיבור רגיל, הוא מתמקד בהבנה אקוסטית של שירים וקטעים מוזיקליים באמצעות פרדיגמת למידה מסוג MLM ושימוש בקודבוקים מבוססי Encodec.

המבנה כולל 24 שכבות של שנאי ומוציא וקטורים בקצב של 75 הרץ, כלומר 75 ייצוגים לכל שנייה של מוזיקה. לפי המפתחים, תכונות שנשלפות משכבות שונות מניבות ביצועים שונים לחלוטין בהתאם למשימה, כך ששווה לבדוק אילו שכבות מספקות את המידע המתאים ביותר לפני שמקבעים את הפייפליין.

מתאים ל

  • סיווג סגנונות ומצבי רוח

    הוא מפיק 75 וקטורים בשנייה מתוך 160 אלף שעות אימון, ומאפשר לאמן מסווג מהיר ומדויק מעל השכבות שלו.

  • זיהוי כלי נגינה בהקלטות

    אימון ב־24 קילוהרץ שומר על תדרים גבוהים שחיוניים להבדלה בין כלים דומים בתוך מיקס מורכב.

  • חילוץ תכונות ליצירת מוזיקה

    השימוש בקודבוקים של Encodec הופך את הווקטורים שלו למתאימים כמדריכים למודלים של יצירת סאונד.

איפה זה נופל

האימון המקדים התבצע על מקטעים של 5 שניות בלבד. זה אומר שהוא לא רואה מבנה מוזיקלי רחב של שיר שלם ברצף אחד, ואתם תצטרכו לחתוך את האודיו לחלונות קצרים ולמזג את התוצאות בעצמכם. בנוסף, חילוץ התכונות תלוי מאוד בבחירת השכבה הנכונה, ואין שכבה אחת שמוגדרת כטובה ביותר לכל המשימות מראש.

אותה משפחה

MERT יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מטפלים בשירים שנמשכים יותר מ־5 שניות?

חותכים את קובץ האודיו למקטעים קצרים של 5 שניות בקצב דגימה של 24 קילוהרץ ומעבירים אותם במודל בזה אחר זה. לאחר מכן מחברים או ממצעים את הווקטורים שמתקבלים כדי לקבל ייצוג לקטע המלא.

מאיזו שכבה כדאי לחלץ את המידע למשימה שלי?

הכרטיס מדגיש שביצועי השכבות משתנים מאוד בהתאם למשימה. מומלץ לבצע בדיקה קצרה שמשווה את התוצאות מכמה שכבות שונות מתוך ה־24 לפני שמחליטים על שכבה קבועה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בלי צורך בתשתיות מורכבות, אך קבצי המודל שוקלים 4.9 גיגה בייט בפורמט float32. תצטרכו כרטיס מסך עם לפחות 6 עד 8 גיגה בייט זיכרון כדי להריץ הסקת מסקנות בצורה חלקה, במיוחד אם אתם מעבדים קטעים ארוכים במקביל.

אם הזיכרון שלכם מוגבל, גרסת ה־95M קלה בהרבה וכוללת 12 שכבות בלבד. אם אתם בונים שירות פנימי לעיבוד קבצים ולא חייבים להחזיק שרת דלוק כל הזמן, פריסה בשרת לפי דרישה תהיה זולה יותר מלהחזיק GPU רציף.

from transformers import pipeline

pipe = pipeline("audio-classification", model="m-a-p/MERT-v1-330M")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 4.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאוסר שימוש מסחרי מכל סוג. אתם יכולים לבצע מחקר, לבדוק רעיונות ולבנות פרויקטים פנימיים, אבל אסור לשלב אותו במוצר שמייצר הכנסות או נמכר ללקוחות בלי לקבל היתר נפרד מהיוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗