GPT
M

musicgen-stereo-large

קוד פתוח

facebookcc-by-nc-4.02023-10-23

  • transformers
  • pytorch
  • safetensors
  • musicgen
  • text-to-audio

גרסת הסטריאו הגדולה של מטא מייצרת מוזיקה מטקסט בשני ערוצים נפרדים. היא מיועדת למי שחייב עומק שמע ומרחב סטריאופוני ולא מוכן להסתפק במונו שטוח.

  • 3.5Bפרמטרים
  • 19.0 GBמשקל הקבצים
  • 2,464הורדות בחודש
  • 100לייקים

מה זה

מטא לקחה את גרסת 3.3 מיליארד הפרמטרים ואימנה אותה מחדש בכיול עדין של 200 אלף צעדים כדי לפלוט שני ערוצי שמע מקבילים. המודל מתבסס על טוקנייזר EnCodec בתדר 32kHz וארבעה ספרי קודים, כשהוא חוזה את הצלילים בצעדים בודדים במקום לעבוד בסבבים ארוכים ומתישים.

לפי המדדים שנבדקו על MusicCaps, גרסת הלארג' מגיעה לציון מרחק אודיו FAD של 5.48, שזה דווקא ציון נמוך יותר מגרסת ה־small שקיבלה 4.88. מצד שני, מדד ה־KLD עומד על 1.37 ועקביות הטקסט עומדת על 0.28, כך שהיא נצמדת טוב יותר להגדרות הסגנוניות של הטקסט לעומת הדגמים הקטנים. מה שמקבלים כאן זה צליל רחב יותר עם כיווניות ברורה, על חשבון ביצועים גולמיים שנראים פחות טוב על הנייר.

מתאים ל

  • מחקר אודיו חישובי

    ניתוח האופן שבו מודלי שפה מייצרים ערוצי סטריאו מקבילים בהשהיה.

  • אב טיפוס לרקעי שמע

    בדיקת רעיונות לסקיצות מוזיקליות באוזניות בלי להסתבך עם המרות מונו.

  • השוואת מודלים מקומית

    בנצ'מרק של איכות הפיצול הסטריאופוני מול מודלים פתוחים אחרים.

איפה זה נופל

היוצרים ניקו את כל השירה מדאטה האימון בעזרת כלי הפרדה כדי להשאיר רק קטעים כליים, ולכן הוא לא יודע לייצר קולות אנושיים אמיתיים. בנוסף, הוא אומן באנגלית בלבד ופרומפטים בעברית יתנו תוצאות גרועות או חסרות קשר.

יש לו גם נטייה לדעוך פתאום לשקט מוחלט באמצע היצירה כי הוא מזהה סוף שיר, והוא מוטה מאוד לסגנונות מערביים. אם אתם בונים על מוזיקה ים־תיכונית או מזרחית, תצטרכו לעשות המון ניסוי וטעייה עם ניסוחי הפרומפט כדי להתקרב לתוצאה סבירה.

שאלות
נפוצות

אפשר לתת לו קובץ מנגינה קיים כדי שימשיך אותו בסטריאו?

לא במודל הזה. הגרסה הזו מפיקה מוזיקה מטקסט בלבד, ואם אתם צריכים הנחיית מלודיה מאודיו קיים תצטרכו להוריד את גרסת melody large.

כמה זיכרון כרטיס מסך הוא תופס בפועל בזמן ריצה?

הקבצים לבדם תופסים 19 גיגהבייט בזיכרון, ובזמן הפקת האודיו תצטרכו עוד מרווח עבודה, כך שכרטיס של 16 גיגהבייט לא יספיק וצריך לפחות 24 גיגהבייט VRAM.

הוא מסוגל להבין שמות של כלי נגינה וסגנונות בעברית?

הוא אומן על טקסט באנגלית בלבד. אם תכתבו לו תיאורים בעברית תקבלו ג'יבריש מוזיקלי או צלילים אקראיים, ולכן חובה לתרגם כל בקשה לאנגלית לפני השליחה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־19 גיגהבייט והמודל רץ בדיוק float16. כדי לטעון אותו לזיכרון וגם לייצר אודיו בלי לקרוס מחוסר VRAM, צריך כרטיס מסך חזק של 24 גיגהבייט לפחות, כמו RTX 3090, RTX 4090 או כרטיסי שרת ייעודיים.

אפשר להריץ אותו מקומית עם ספריית transformers הרגילה של פייתון או דרך ספריית audiocraft המקורית שמחייבת התקנת ffmpeg. מי שאין לו חומרה מתאימה מקומית יעדיף לפתוח את הנוטבוק ב־Colab או לשלם על מופע ענן לפי שעה, כי החזקת שרת פרטי דולק בשבילו תהיה יקרה וכבדה מדי.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="facebook/musicgen-stereo-large")
print(pipe("שלום"))

הרישיון

המשקלים שוחררו תחת רישיון CC-BY-NC 4.0, מה שאומר שאסור להשתמש בהם לשום מטרה מסחרית או לשלב אותם במוצר מניב. הקוד של הפרויקט עצמו אמנם מופץ ברישיון MIT חופשי, אבל המודל הזה מתאים אך ורק למחקר, בדיקות פנימיות ולמידה אישית.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗