GPT
S

SplitTrack2MusicGen

רץ בדפדפן

fffilonicc-by-nc-4.02023-06-12

  • gradio
  • music generation
  • language models
  • LLMs

היישום לוקח קטע אודיו שתעלו, מבודד מתוכו ערוץ נבחר ומייצר סביבו מוזיקה חדשה בעזרת הנחיית טקסט. הוא מתאים ליוצרים שרוצים לבנות פלייבק או עיבוד חדש על בסיס מנגינה קיימת.

  • הורדות בחודש
  • 164לייקים

מה זה

אתם מעלים קובץ קול ובוחרים ערוץ ספציפי כמו שירה, בס או תופים. לצד זה כותבים תיאור טקסטואלי של הסגנון המוזיקלי המבוקש, למשל מקצב אלקטרוני רגוע או קטע ג'אז, ובוחרים את משך היצירה הרצוי. בתום העיבוד מקבלים קובץ שמע חדש שמשלב בין המנגינה של הערוץ המקורי לבין הסגנון שהגדרתם בטקסט.

מאחורי הממשק רץ המודל musicgen-melody מבית מטא דרך ספריית Audiocraft. המודל מחלץ ייצוג כרומה מהקטע שהזנתם ומייצר אודיו ברזולוציה של 32 קילוהרץ תוך שימוש במקודד EnCodec ובארבעה ספרי קוד במקביל.

מתאים ל

  • בניית ליווי לשירה

    מעלים ערוץ קולי נקי, מגדירים סגנון מוזיקלי בתיבת הטקסט ומקבלים ליווי שמתאים את עצמו למלודיה המקורית.

  • עיבוד מחדש לבייסליין

    מבודדים את תפקיד הבס מתוך הקלטה קיימת ויוצרים סביבו קטע מוזיקלי שונה לחלוטין באורך של עד חצי דקה.

  • בדיקת כיווני הפקה

    מזינים קטע קיים כדי לבחון במהירות שילובים של סגנונות ומקצבים חדשים לפי הנחיות מילוליות שונות.

איפה זה נופל

ההגבלה הקשיחה ביותר היא אורך הקטע, שמגיע עד 30 שניות בלבד. אפשרות הדבקת קישורי יוטיוב מנוטרלת לחלוטין בקוד, כך שחובה להחזיק בקובץ מקומי. בנוסף, בחירת מודלים אחרים כמו גרסת ה־large חסומה בקוד ומקובעת רק על גרסת המלודיה.

שאלות
נפוצות

האם השימוש ביישום כרוך בתשלום?

לא, הגישה לממשק היא ללא עלות. עם זאת, היישום מוגדר כרגע במצב מושהה ולכן לא ניתן להריץ אותו ברשת עד שיופעל מחדש.

האם אפשר להשתמש בקישור מיוטיוב במקום להעלות קובץ?

לא. האפשרות להזין קישור מיוטיוב מושבתת ישירות בקוד הממשק, וחייבים להעלות קובץ אודיו מהמחשב האישי.

האם ניתן להריץ את המערכת על המחשב הפרטי?

כן, ספריית Audiocraft זמינה להתקנה מקומית באמצעות פייתון ומודול טורץ'. תצטרכו כרטיס מסך ייעודי עם לפחות 16 גיגה זיכרון כדי להריץ את מודל המלודיה בצורה יציבה.

במה הממשק שונה משימוש במודל MusicGen המקורי?

הממשק מוסיף שלב מקדים של בחירת ערוץ בודד מתוך השיר לפני ההזנה למודל. הוא גם נועל את השימוש למודל המלודיה בלבד ומגביל את אורך היצירה לעד 30 שניות.

איך משתמשים

טוענים קובץ אודיו ישירות מהמחשב, בוחרים בלחיצה את הערוץ לבידוד, מזינים תיאור מילולי, מכוונים את משך השניות ואת מקדם ההנחיה, ולוחצים על Submit. זמן הריצה תלוי בחומרה שמוגדרת כמעבד גרפי מסוג T4, אך נכון לעכשיו היישום נמצא במצב מושהה ולא מייצר פלט באופן מיידי.

הרישיון

המשקולות של המודל כפופות לרישיון cc-by-nc-4.0, שאינו מתיר שימוש מסחרי מכל סוג. קוד הפרויקט עצמו שוחרר ברישיון MIT, אך כל קובץ שמע שנוצר דרך המודל מוגבל לשימוש אישי ומחקרי בלבד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗