GPT
M

musicgen-large

קוד פתוח

facebookcc-by-nc-4.02023-06-08

  • transformers
  • pytorch
  • musicgen
  • text-to-audio
  • endpoints_compatible

הגרסה הגדולה ביותר במשפחת מחוללי המוזיקה של מטא מייצרת קטעי אודיו של 32kHz מטקסט. היא מיועדת למי שמחפש איכות צליל מקסימלית ומוכן לשלם על זה במשאבי זיכרון כבדים.

  • 19.1 GBמשקל הקבצים
  • 88,903הורדות בחודש
  • 539לייקים

מה זה

מודל אוטורגרסיבי מבוסס טרנספורמר עם 3.3 מיליארד פרמטרים שמייצר מוזיקה ישירות מתיאור טקסטואלי. הוא עובד מעל טוקנייזר EnCodec בקצב דגימה של 32kHz ומשתמש בארבעה ספרי קוד במקביל עם היסט זמנים קצר ביניהם. המבנה הזה מאפשר לו לייצר אודיו בחמישים צעדים בלבד לשנייה, בלי להסתמך על ייצוג סמנטי נפרד כמו מודלים מתחרים.

האימון נעשה על עשרים אלף שעות של מוזיקה ברישיון ממאגרים מסחריים, כולל שאטרסטוק ופונד5, לאחר סינון קפדני שהסיר שירה והשאיר רק קטעים כליים. במדדי הבנצ'מרק של MusicCaps הוא מציג דיוק תוכן וטקסט של 0.28 ומדד התפלגות תוויות של 1.37, תוצאות שמשקפות התאמה טובה לתיאור, אם כי מדד מרחק האודיו שלו עומד על 5.48 ונחות מעט מהגרסאות הקטנות יותר.

מתאים ל

  • מחקר אקדמי בעיבוד אודיו

    חקר יכולות יצירת אודיו מטקסט במודל רחב ללא צורך בייצוג סמנטי מקדים.

  • יצירת סקיצות להלחנה

    בדיקת כיוונים מוזיקליים ראשוניים ורעיונות לקטעים אינסטרומנטליים לשימוש עצמי.

  • הדגמות וניסויי קוד

    התנסות בספריית audiocraft או transformers על חומרה חזקה לצורכי לימוד.

איפה זה נופל

היוצרים מציינים במפורש שהמודל לא מסוגל לייצר קולות שירה אנושיים אמינים, כי כל הדאטה עבר סינון קולות מראש. הוא אומן על תיאורים באנגלית בלבד, כך שטקסט בעברית או בשפות אחרות לא יניב תוצאות טובות, והוא רגיש מאוד לניסוח ומחייב ניסוי וטעייה כדי להגיע לצליל המבוקש. בנוסף, יש לו נטייה לדעוך פתאום לשקט באמצע הקטע כאילו השיר הסתיים, והביצועים שלו אינם אחידים בין סגנונות ותרבויות שונות.

שאלות
נפוצות

אפשר להשתמש בו כדי ליצור פסקול למשחק מסחרי?

לא. משקלי המודל משוחררים ברישיון cc-by-nc-4.0 שאוסר כל שימוש מסחרי ישיר או עקיף. הרישיון הזה מגביל את השימוש לצורכי מחקר והתנסות אישית בלבד.

למה התוצאה משתתקת פתאום באמצע הנגינה?

הכרטיס מציין שהמודל סובל מקריסה לסילנס ומייצר לעיתים סיומות שיר מוקדמות מדי. זו מגבלה מוכרת במודל שדורשת לרוב לנסות שוב עם סיד שונה או לשנות את הניסוח בטקסט.

אפשר להזין לו הנחיות בעברית?

הוא אומן על מאגרי נתונים עם תיאורים באנגלית בלבד. טקסט בעברית לא יעבוד בצורה צפויה, ולכן צריך לתרגם את התיאור לאנגלית לפני השליחה להסקה.

איך מריצים

המודל שוקל 19.1 גיגה בייט ומגיע בפורמט float32, מה שאומר שצריך כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כדי לטעון אותו ולהריץ הסקה בלי לקרוס. אפשר להריץ אותו מקומית דרך ספריית transformers מגרסה 4.31.0 ומעלה או ישירות דרך חבילת audiocraft של מטא יחד עם ffmpeg מותקן במערכת.

אם אין לכם חומרה ייעודית כזו, הגרסאות הקלות יותר עם 300 מיליון או 1.5 מיליארד פרמטרים ירוצו על כרטיסים ביתיים רגילים. לקרוא למודל דרך שרת מרוחק או סביבת בדיקה עדיף בהרבה על תחזוקה עצמית, אלא אם הפרויקט שלכם דורש שליטה מלאה בצינור היצירה ובפרמטרי הדגימה.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="facebook/musicgen-large")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון MIT, אבל משקלי המודל משוחררים תחת רישיון cc-by-nc-4.0. המשמעות פשוטה: אסור להשתמש במודל הזה לכל מטרה מסחרית, מוצר מניב הכנסות או שירות בתשלום. הוא מותר למחקר ולניסויים אישיים בלבד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗