GPT
M

musicgen-stereo-small

קוד פתוח

facebookcc-by-nc-4.02023-10-23

  • transformers
  • pytorch
  • safetensors
  • musicgen
  • text-to-audio

גרסת הסטריאו הקטנה מייצרת מוזיקה בשני ערוצים מתיאור טקסטואלי, בלי לתפוס נפח עצום בזיכרון. מי שרוצה סאונד מרחבי לפרויקט אישי בחומרה ביתית יקבל כאן פשרה סבירה בין משאבים לאיכות.

  • 608Mפרמטרים
  • 7.6 GBמשקל הקבצים
  • 2,056הורדות בחודש
  • 45לייקים

מה זה

מטא לקחה את גרסת הבסיס ואימנה אותה במשך 200 אלף צעדים נוספים כדי לפלוט שני ערוצי אודיו במקביל במקום ערוץ מונו בודד. הארכיטקטורה משתמשת במודל שפה מבוסס טרנספורמר עם טוקנייזר EnCodec בקצב 32 קילוהרץ, ומייצרת ארבעה ספרי קוד במעבר אחד עם מרווח זמן קצר ביניהם. השיטה הזו מאפשרת חיזוי במקביל וחוסכת ריצות כבדות, כך שהיא דורשת רק 50 צעדים אוטורגרסיביים לכל שניית שמע.

התוצאה היא שמע עם עומק וכיווניות שמתאים להאזנה באוזניות, בשונה מגרסאות המונו הרגילות. במדדי MusicCaps גרסת ה־Small הבסיסית קיבלה ציון Frechet Audio Distance של 4.88, שנחשב קרוב מאוד למודלים הגדולים בסדרה ואפילו מציג מרחק נמוך יותר מהם על הנייר, לצד עקביות טקסט של 0.27. בפועל זה אומר שאתם מקבלים סאונד מגוון ורחב יחסית לגודל, בלי לשלם עלויות עיבוד של מודלים ענקיים.

מתאים ל

  • מחקר אודיו גנרטיבי

    ניתוח יכולות של טוקניזציה רב-ערוצית ומחקר על ביצועי מודלי שפה בייצור צליל.

  • פיתוח אבות-טיפוס למשחקים

    יצירת מוזיקת רקע ניסיונית בסטריאו לפרויקטים אישיים ללא כוונת רווח.

  • בדיקת פרומפטים מוזיקליים

    איטרציות מהירות על תיאורי טקסט באנגלית בחומרה מקומית לפני מעבר למודלים כבדים.

איפה זה נופל

היוצרים מציינים במפורש שהמודל לא מסוגל לייצר קולות שירה אנושיים אמינים. כל נתוני האימון נוקו משירה באמצעות כלי הפרדת מקורות, כך שתקבלו רק קטעים כליים. בנוסף, האימון התבסס כולו על תיאורים באנגלית בלבד. פרומפטים בעברית או בשפות אחרות יניבו תוצאות חלשות, שגיאות, או ג'יבריש מוזיקלי לחלוטין.

יש למודל גם נטייה לקרוס לשקט מוחלט באמצע היצירה או לזייף סיומות של שירים בלי קשר להנחיה. מאגר האימון מבוסס על כ־20 אלף שעות מספריית מוזיקה מורשית, ולכן קיימת הטיה ברורה לסגנונות מערביים מסחריים. תרבויות וסגנונות מוזיקליים פחות נפוצים פשוט לא יישמעו טוב.

שאלות
נפוצות

האם אפשר לתת למודל קובץ שמע קיים שישמש כמלודיה בסיסית?

לא בדגם הזה. גרסת stereo-small מקבלת אך ורק טקסט חופשי בתור קלט. אם אתם חייבים הכוונה לפי מלודיה קיימת, תצטרכו להשתמש בדגמי melody או stereo-melody, שהם גדולים יותר ודורשים משאבי חישוב כבדים בהרבה.

האם כדאי להריץ את המודל על מעבד רגיל ללא כרטיס מסך?

טכנית זה אפשרי דרך ספריית transformers, אבל בפועל זה יהיה איטי בצורה מייאשת. יצירה של כמה שניות שמע עלולה לקחת דקות ארוכות של עיבוד במעבד רגיל, ולכן לא מומלץ לעבוד איתו ללא כרטיס גרפי תומך CUDA.

האם אפשר להשתמש במוזיקה שנוצרה בתוך סרטון יוטיוב ממונטז?

לא. תנאי הרישיון cc-by-nc-4.0 אוסרים מפורשות כל שימוש מסחרי ישיר או עקיף בתוצרי המשקלים. סרטון שמייצר הכנסות מפרסומות מפר את תנאי הרישיון של מטא.

איך מריצים

המודל שוקל 7.6 גיגה-בייט ומכיל כ־608 מיליון פרמטרים בדיוק float16. כדי להריץ אותו מקומית תצטרכו כרטיס מסך עם לפחות 8 עד 12 גיגה-בייט של VRAM. ההרצה עצמה מתבצעת ישירות דרך ספריית transformers הרשמית בפייתון בעזרת pipeline פשוט מסוג text-to-audio, או דרך ספריית audiocraft של מטא יחד עם ffmpeg מותקן במערכת.

אם יש לכם כרטיס חלש יותר, מחשב בלי GPU ייעודי, או שאתם מחפשים לשלב תכונות כמו שליטה באמצעות קובץ מלודיה קיים, עדיף להשתמש בגרסת melody גדולה יותר או לגשת ל־API בענן. המודל הזה מתאים בעיקר לבדיקות מקומיות מהירות וליצירת סקיצות אודיו כשרוצים עצמאות מלאה ולא תלות בשרתים חיצוניים.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="facebook/musicgen-stereo-small")
print(pipe("שלום"))

הרישיון

משקלי המודל שוחררו תחת רישיון cc-by-nc-4.0, מה שאומר שאסור להשתמש בהם לכל מטרה מסחרית או לשלב אותם במוצר מניב. השימוש מוגבל למחקר, ניסויים ולמידה עצמית בלבד, וחובה לתת קרדיט ליוצרים. קוד המקור בספריית audiocraft זמין אמנם תחת רישיון MIT, אך המשקלים עצמם מוגבלים לחלוטין.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗