GPT
M

mustango

קוד פתוח

declare-labapache-2.02023-11-15

  • transformers
  • music
  • text-to-audio
  • text-to-music
  • endpoints_compatible

הכלי הזה מייצר קטעי מוזיקה מתיאור טקסט חופשי עם דגש על שליטה במבנה המוזיקלי. הוא פונה למי שצריך אקורדים ומקצב מוגדרים במקום סתם רעש רקע כללי.

  • 11.5 GBמשקל הקבצים
  • 1,633הורדות בחודש
  • 42לייקים

מה זה

בבסיס שלו יושבים מודל דיפוזיה מסוג Latent Diffusion ומקודד הטקסט Flan-T5 Large. הוא אומן על מאגר MusicBench שמכיל 52 אלף קטעי מוזיקה עם תיאורים טקסטואליים מפורטים, במטרה לתת למשתמש שליטה אמיתית במאפיינים כמו קצב, הרמוניה ואקורדים ספציפיים מתוך הפרומפט.

במבחני האזנה מול Tango, המודל הקודם של אותה מעבדה, הוא קיבל ציונים גבוהים משמעותית בדיוק של האקורדים עם ציון של 5.76 לעומת 3.61, ובהתאמת הקצב עם 4.98 לעומת 3.86. המשמעות בשטח היא שאם אתם מבקשים מקצב מסוים או ליווי אקורדים מסוים, הוא באמת נשמע קרוב למה שכתבתם ולא ממציא משהו אקראי לחלוטין.

מתאים ל

  • סקיצות לפסקול

    הוא מבין תיאורים מוזיקליים של אקורדים ומקצב, מה שמאפשר לייצר רעיונות מהירים לפי הוראות בימוי.

  • ג'ינגלים וקטעי רקע

    הוא תוכנן לייצר קטעים לפי אווירה וכלי נגינה ספציפיים, כמו חליל או תופים אלקטרוניים, שמתאימים לפרסומות קצרות.

  • אימון מודלים מותאמים

    קוד האימון פתוח לחלוטין ומאפשר להמשיך אימון של מודל הדיפוזיה מול קבצי הגדרות מוזיקליים משלכם.

איפה זה נופל

הפלט מיוצר בקצב דגימה נמוך של 16kHz בלבד. זה מספיק לסקיצה, בדיקת רעיון או מוזיקת רקע בסיסית, אבל רחוק מאוד מאיכות אולפנית של 44.1kHz שמתאימה לשידור או להפקה מסחרית נקייה.

בנוסף, כל הדוגמאות והאימונים נשענים על אנגלית בלבד. אם תזינו תיאורים בעברית, מקודד הטקסט כנראה לא יבין מה אתם רוצים מהמקצב או מהכלים ותקבלו תוצאות מרוחות.

שאלות
נפוצות

האם המודל תומך בהזנת פרומפטים בעברית?

לא. מקודד הטקסט Flan-T5 ומאגר הנתונים MusicBench מבוססים על אנגלית. תיאורים מוזיקליים בעברית יובילו כנראה לפלט אקראי או לשגיאות הבנה.

האם אפשר להשתמש במוזיקה שהוא מייצר ישירות בפודקאסט או בסרטון מסחרי?

מבחינת הרישיון של Apache 2.0 מותר להשתמש בתוצרים באופן מסחרי. החיסרון הוא איכות השמע, שהיא 16kHz בלבד ועלולה להישמע עמומה בפרויקט מקצועי.

מה ההבדל בין קובץ המודל הזה לגרסת Pretrained שלו?

הגרסה הזו עברה כוונון ייעודי על מאגר MusicBench שמחדד את ההבנה של מבנים מוזיקליים. גרסת הבסיס מתאימה בעיקר למי שרוצה לאמן את המערכת מאפס על דאטה משלו.

איך מריצים

המשקל הכולל של הקבצים מגיע ל 11.5 גיגה בייט, כך שתצטרכו מאיץ גרפי עם לפחות 16 גיגה זיכרון כדי לטעון ולהריץ אותו בצורה חלקה דרך הקוד של המפתחים. ההתקנה דורשת שיבוט של הריפו שלהם, התקנת תלויות וגרסה מותאמת של ספריית diffusers, כך שלא מדובר בהתקנה נקייה של שורה אחת מתוך Transformers.

אם אתם רק רוצים לבדוק פרומפטים או לייצר קטעים בודדים בלי לתחזק שרת ייעודי, עדיף להשתמש בהדגמה הפעילה ב Replicate או ב HuggingFace Spaces במקום להוריד את כל המשקל הזה למחשב מקומי.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="declare-lab/mustango")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗