GPT
M

MERT-v1-95M

קוד פתוח

m-a-pcc-by-nc-4.02023-03-17

  • transformers
  • pytorch
  • mert_model
  • feature-extraction
  • music

מודל קומפקטי להבנת אודיו ומוזיקה שמיועד לחילוץ מאפיינים וסיווג. הוא אומן על עשרים אלף שעות מוזיקה בדגימה של 24kHz ומתאים למי שמחפש פתרון קל משקל לעיבוד סאונד.

  • 1.6 GBמשקל הקבצים
  • 94,959הורדות בחודש
  • 54לייקים
  • 12שכבות

מה זה

מדובר במודל שמנתח קטעי מוזיקה וממיר אותם למאפיינים וקטוריים בקצב של 75 הרץ. הוא בנוי על 12 שכבות טרנספורמר ברוחב 768 ומפיק ייצוגים שמתאימים למשימות סיווג מוזיקלי במורד הזרם. המודל אומן בשיטת MLM עם תוויות מקודד שמע של EnCodec בשמונה ספריות קוד, בשילוב רעש מעורבב ישירות בתוך הבאץ'.

בהשוואה לגרסת הבסיס v0, המודל הזה אומן על כמות שמע גדולה פי עשרים ותומך בתדר דגימה של 24 קילו-הרץ במקום 16 בלבד. השינוי במבנה התוויות והעלייה באיכות הדגימה מאפשרים לחלץ מידע אקוסטי עשיר יותר ומכוונים גם לתמיכה עתידית ביצירת מוזיקה.

מתאים ל

  • סיווג סגנונות ומצבי רוח

    חילוץ וקטורים מקטעי שמע קצרים והזנתם למסווג פשוט לצורך תיוג ז'אנרים.

  • חיפוש מוזיקלי לפי דמיון

    השוואת קטעי מוזיקה באמצעות הייצוגים שהשכבות השונות מייצרות בקצב 75 הרץ.

  • ניתוח אקוסטי קל משקל

    עיבוד אודיו על חומרה ביתית או שרתים צנועים בלי לפגוע בקצב העבודה.

איפה זה נופל

חלון ההקשר שהמודל רואה באימון מוגבל לחמש שניות בלבד. אם יש לכם קטעים ארוכים או שאתם מחפשים מבנה מוזיקלי מורכב לאורך דקות, תצטרכו לחתוך את האודיו למקטעים ולחבר את התוצאות בעצמכם. בנוסף, חילוץ המאפיינים משתנה מאוד בין שכבה לשכבה ברשת, כך שתצטרכו לבדוק ידנית איזו שכבה נותנת תוצאות טובות למשימה הספציפית שלכם.

אותה משפחה

MERT יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה תדר שמע צריך להזין למודל?

המודל אומן על שמע בתדר דגימה של 24kHz. קבצים בתדרים אחרים יעבדו רק אם תמירו אותם מראש לתדר הזה, אחרת הייצוגים שייווצרו לא יהיו מדויקים.

האם כדאי להשתמש בגרסה הזו או בגרסת 330M?

אם המשאבים מוגבלים ואתם רצים על מחשב אישי, 95M מספק נקודת פתיחה קלה ומהירה. גרסת ה־330M ראתה 160 אלף שעות מוזיקה לעומת עשרים אלף כאן, כך שהיא תתאים יותר למי שחייב ביצועים מקסימליים ויש לו GPU חזק.

איך מריצים

בזכות משקל של 1.6 גיגה-בייט ודיוק float32, אפשר להריץ אותו בקלות על כל מעבד מודרני או כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון. הקוד נשען על ספריית transformers הסטנדרטית, כך שהטעינה וההרצה בסביבת פייתון פשוטות מאוד.

אם אתם צריכים דיוק מקסימלי ויש לכם שרת ייעודי, קיים אח גדול עם 330 מיליון פרמטרים שאומן על פי שמונה יותר נתונים. לגרסה הזו של 95 מיליון הולכים כשרוצים להריץ לוקאלית בזול, בלי לשלם על API חיצוני ובלי להעמיד תשתית יקרה.

from transformers import pipeline

pipe = pipeline("audio-classification", model="m-a-p/MERT-v1-95M")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0, שמשמעותו שימוש לא מסחרי בלבד. מותר לחקור, לפתח פרויקטים פנימיים ולעשות ניסויים, אבל אסור לשלב אותו כחלק ממוצר שמכניס כסף או נמכר ללקוחות. מי שבונה שירות מסחרי יצטרך לחפש חלופה אחרת.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗