GPT
M

musicgen-small

קוד פתוח

facebookcc-by-nc-4.02023-06-08

  • transformers
  • pytorch
  • safetensors
  • musicgen
  • text-to-audio

הופך טקסט לקטעי מוזיקה קצרים בלי להסתבך עם מודלים כבדים. הגרסה הקטנה הזו עובדת מהר על חומרה מקומית בסיסית יחסית.

  • 591Mפרמטרים
  • 5.4 GBמשקל הקבצים
  • 170,088הורדות בחודש
  • 509לייקים

מה זה

המודל מייצר אודיו מונו באיכות 32kHz ישירות מתיאור טקסטואלי, כמו סגנון, כלים או קצב. במקום לייצר ייצוגים סמנטיים מורכבים בנפרד, הוא משתמש בטוקנייזר EnCodec עם ארבעה ספרי קודים ומנחש אותם במקביל עם השהיה קטנה, מה שמאפשר לו לרוץ בקצב של 50 צעדים בלבד לכל שניית שמע.

האימון שלו נשען על עשרים אלף שעות של מוזיקה ברישיון, שעברה ניקוי קפדני של שירה באמצעות מודל הפרדת מקורות. בבדיקות אובייקטיביות מול בנצ'מרק MusicCaps, גרסת ה־Small השיגה ציון Frechet Audio Distance של 4.88 ומדד KLD של 1.42, תוצאות שמעידות על איכות הפקה בסיסית טובה מאוד ביחס למשקל שלה.

מתאים ל

  • סקיצות לסאונדטרק למשחקים

    מייצר קטעי אווירה אינסטרומנטליים לפי דרישה ברקע במהירות, בלי להעמיס על המחשב של המפתח.

  • מחקר בתחום האודיו

    בדיקת יכולות יצירה של מודלים אוטורגרסיביים על חומרה מקומית קלה וחסכונית במשאבים.

  • יצירת אפקטים ודגימות רקע

    הפקת רעיונות מוזיקליים מהירים באורך שניות בודדות לשימוש עצמי בתוכנות עריכה.

איפה זה נופל

הוא לא יודע לייצר שירה אנושית או קולות מציאותיים, נקודה. כל הדאטה אומן רק על קטעים כליים אחרי סינון, כך שאם אתם בונים על שיר עם פזמון תקבלו במקרה הטוב רעש לא ברור. בנוסף, המודל אומן רק על תיאורים באנגלית ואינו מבין שפות אחרות, סובל מהטיה ברורה לז'אנרים מערביים, ולפעמים קורס לשקט פתאומי באמצע הקטע ללא התראה מוקדמת.

שאלות
נפוצות

האם אפשר לכתוב פרומפטים בעברית?

לא. המודל אומן כולו על תיאורים באנגלית בלבד. אם תזינו עברית, תקבלו תוצאות אקראיות לגמרי או קובץ שקט, לכן חובה לתרגם את התיאור לפני השליחה.

למה המוזיקה נקטעת לשקט מוחלט באמצע הריצה?

זו בעיה ידועה שמופיעה בתיעוד הרשמי של המודל. לפעמים הוא פשוט קורס לשקט, וכדי לעקוף את זה צריך לייצר כמה דגימות במקביל או לשנות מעט את ניסוח הפרומפט.

איך מריצים

אתם יכולים להריץ אותו דרך ספריית transformers הרגילה באמצעות pipeline פשוט של text-to-audio, או לעבוד עם ספריית audiocraft המקורית של מטא שדורשת גם התקנה של ffmpeg. קובצי המשקלים תופסים בערך 5.4 גיגה בייט בזיכרון, כך שכרטיס מסך פשוט עם 6 עד 8 גיגה בייט VRAM מספיק לגמרי כדי לחלץ תוצאות מקומית בלי לחנוק את המחשב.

אם אתם צריכים הנחיה לפי מנגינה קיימת ולא רק טקסט, הגרסה הזו לא מתאימה ותצטרכו לבחור בגרסת ה־melody. למי שמחפש רק לבדוק רעיונות בלי להגדיר סביבת פייתון, עדיף להשתמש ב־Spaces החינמי של Hugging Face במקום להוריד חמישה גיגה בייט לדיסק.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="facebook/musicgen-small")
print(pipe("שלום"))

הרישיון

הקוד עצמו חופשי תחת רישיון MIT, אבל משקלי המודל מוגנים ברישיון CC-BY-NC-4.0. זה אומר שמותר להשתמש בהם למחקר, פיתוח פנימי ולמידה בלבד, אך אסור לשלב אותם במוצר מסחרי, לגבות עליהם כסף או למכור את תוצרי האודיו ישירות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗