GPT
M

M2UGen-Demo

רץ בדפדפן

M2UGenmit2024-01-02

  • gradio

הכלי מייצר מוזיקה ועורך קטעי אודיו קיימים על בסיס טקסט, תמונות או וידאו. הוא מתאים למי שרוצה לבדוק יצירת סאונד מותאם למדיה ויזואלית בלי לגעת בתוכנות עריכה.

  • הורדות בחודש
  • 94לייקים

מה זה

הממשק מבוסס על צ'אט שבו מזינים הנחיה טקסטואלית לצד קובץ מדיה לבחירה: תמונה, אודיו או וידאו. בפלט מקבלים תשובה בצ'אט וקטע אודיו מיוצר, כשאפשר לקבוע מראש את אורך הצליל בין 5 ל־30 שניות ולשלוט בטמפרטורה וב־Top P.

מאחורי הקלעים רצה ארכיטקטורה כבדה שמשלבת כמה מודלים יחד. הקוד טוען מודלי ראייה כמו ViT של גוגל, עיבוד שפה באמצעות Flan-T5, ומודלי יצירת שמע מובילים כולל MusicGen של פייסבוק ו־AudioLDM2.

הדוגמאות המוכנות מציגות יצירת מוזיקה שמתאימה לאווירה של תמונה בשחור-לבן, הפקת צליל לפי כלי נגינה שמופיע בתמונה, והחלפת כלי נגינה בתוך קובץ שמע קיים, כמו החלפת פסנתר בגיטרה אקוסטית או חילוץ תופים.

מתאים ל

  • התאמת מוזיקה לתמונות

    מעלים תמונה או וידאו ומבקשים לייצר קטע קול לפי האווירה או הכלים שמזוהים בפריים.

  • עריכת כלים בקובץ קיים

    מזינים קובץ אודיו ומבקשים להחליף כלי נגינה ספציפי, למשל להמיר פסנתר בגיטרה.

  • בידוד מקצבים משמע

    מבודדים ערוצים ספציפיים מתוך שיר, כמו חילוץ תופים מתוך קטע מוזיקלי נתון.

איפה זה נופל

הבעיה המיידית היא שההדגמה שבורה לחלוטין בגלל שגיאת ריצה. מעבר לזה, חיבור של כל כך הרבה מודלים שונים יוצר תלות כבדה, וכל חוסר התאמה בין זיהוי התמונה למודל המוזיקה מוביל לתוצאה לא קשורה.

ההדגמה גם מגבילה את אורך האודיו ל־30 שניות בלבד. אי אפשר לבנות כאן רצועות ארוכות או לצפות להבנה של עברית בהנחיות הטקסט, שכן מודלי הבסיס מאומנים באנגלית.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה בחינם כרגע?

הגישה פתוחה בחינם באתר Hugging Face ללא צורך ברישום. עם זאת, נכון לעכשיו המערכת נמצאת במצב של תקלת הרצה, כך שלא ניתן להפיק דרכה תוצאות עד שהקוד יתוקן.

האם אפשר להריץ את הכלי הזה במחשב האישי?

כן, הקוד פתוח תחת רישיון MIT וזמין להורדה. עם זאת, הוא דורש מפרט חומרה כבד מאוד שכולל מאיצי GPU חזקים כדי להחזיק מודלים מרובים כמו ViT ו־MusicGen במקביל.

מה קורה עם הקבצים שאני מעלה?

הקבצים נשלחים לעיבוד ישירות על השרת שמארח את ההדגמה. הקוד מייצר מזהה ייחודי זמני לכל הפעלה, אך לא כדאי להעלות חומרים רגישים לפלטפורמה ציבורית כזו.

כמה זמן לוקח לייצר קטע מוזיקה?

כשהשרת פעיל, יצירת שמע של עד 30 שניות דרך מודלי דיפוזיה ולמידה עמוקה אורכת בדרך כלל בין כמה עשרות שניות לדקות בודדות. כרגע השירות לא מגיב עקב שגיאה.

איך משתמשים

טוענים קובץ למשבצת המתאימה, כותבים הנחיה בתיבת הטקסט ולוחצים על Submit & Run. אם רוצים לשנות את אורך הקטע, פותחים את ההגדרות המתקדמות וגוררים את הסליידר.

בפועל אין אפשרות להריץ אותה כרגע בדפדפן. המופע מוגדר על חומרת שרת חזקה של שני כרטיסי A10G, אבל נמצא במצב שגיאת ריצה ולכן הממשק תקוע ולא יפיק תוצאות עד שהמפתח יתקן אותו.

הרישיון

הקוד מפורסם תחת רישיון MIT, שמאפשר שימוש חופשי, שינוי והפצה כולל שימוש מסחרי. החומרים שמעלים והאודיו שנוצר כפופים גם לתנאי הרישיונות של המודלים הפנימיים שנמצאים בשימוש, כמו MusicGen ו־Flan-T5.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗