GPT
I

Image-to-MusicGen

רץ בדפדפן

fffilonicc-by-nc-4.02023-06-09

  • gradio
  • music generation
  • language models
  • LLMs

הכלי מייצר קטע מוזיקלי קצר מתוך תמונה שאתם מעלים, עם אפשרות להוסיף קובץ מנגינה להכוונה. הוא מתאים ליוצרים שמחפשים השראה מהירה לפסקול או סתם בדיקה ויזואלית לאודיו.

  • הורדות בחודש
  • 124לייקים

מה זה

אתם מעלים תמונה ומקבלים קובץ שמע של עד 30 שניות. ברקע אין קסם ישיר בין פיקסלים לתווים. התמונה נשלחת קודם כל למודל שנקרא CLIP Interrogator שמחלץ ממנה תיאור טקסטואלי, ורק אז הטקסט הזה מוזן למודל יצירת המוזיקה.

המודל שמפיק את האודיו הוא MusicGen Melody של חברת מטא. אם מעלים קובץ שמע נוסף, המודל מחלץ ממנו מבנה מלודי בסיסי ומשלב אותו עם התיאור שהתקבל מהתמונה כדי לבנות את הקטע החדש. בקוד המקורי קיימת תמיכה בגרסאות נוספות של MusicGen וסדרת Flan T5, אך בממשק הנוכחי הבחירה נעולה על גרסת המלודיה בלבד.

מתאים ל

  • השראה מהירה לפסקול

    מעלים איור או תצלום של סצנה ומקבלים סקיצת אודיו ראשונית שתואמת לאווירה הכללית.

  • שילוב מנגינה קיימת עם תמונה

    מזינים קטע שמע קיים ותמונה חדשה כדי לבנות גרסה מלודית שמושפעת מהמראה של התמונה.

  • בדיקת תרגום ויזואלי לסאונד

    בוחנים כיצד אלגוריתם מתאר תמונות במילים ואיזה סגנון מוזיקלי הוא משייך לתיאור הזה.

איפה זה נופל

התלות בתיאור טקסטואלי היא נקודת התורפה המרכזית. אם המפענח מפספס את האווירה בתמונה ומתאר אותה בצורה יבשה או שגויה, המוזיקה שתצא תהיה מנותקת לחלוטין ממה שראיתם בעיניים.

בנוסף, הממשק לא מאפשר לשלוט בפרמטרים של המודל כמו טמפרטורה או סגנון, וכל מה שנשאר לכם זה רק לקבוע את משך הזמן עד חצי דקה. מי שמצפה לקבל שיר שלם או רצועה מורכבת יגלה שמדובר רק בסקיצה בסיסית.

שאלות
נפוצות

האם השימוש פתוח בחינם?

הגישה לעמוד בהאגינג פייס פתוחה בלי תשלום ובלי צורך במנוי. יחד עם זאת, כרגע הספייס נמצא במצב מושהה. כדי להריץ אותו צריך לשכפל את העמוד לחומרה משלכם או להמתין להפעלתו מחדש.

כמה זמן לוקח לייצר קטע מוזיקלי?

הפקת קטע של כמה שניות דורשת בדרך כלל בין חצי דקה לדקה. התהליך לוקח זמן כי המערכת מעבדת קודם את התמונה לטקסט ורק אחר כך מריצה את מודל השמע על כרטיס T4. אם יש משתמשים נוספים בתור, זמן ההמתנה מתארך.

האם אפשר להריץ את הכלי במחשב האישי?

כן, הקוד פתוח ומבוסס על ספריית Audiocraft של מטא וממשק Gradio. כדי להריץ מקומית דרוש מחשב עם פייתון 3.9, PyTorch וכרטיס מסך בעל 16 גיגה-בייט זיכרון עבור המודלים בגודל בינוני. במחשבים ללא כרטיס גרפי תואם יהיה קשה מאוד לייצר תוצאות.

במה היישום הזה שונה מהרצת מודל MusicGen ישירות?

המודל המקורי של מטא מקבל רק הנחיות טקסט או קובצי מלודיה ולא מסוגל לקרוא תמונות. היישום הזה מחבר כלי נוסף בשם CLIP Interrogator שיוצר את הטקסט באופן אוטומטי מתוך התמונה שלכם. למעשה זהו צינור עבודה שמתווך בין קובץ התמונה לבין מודל האודיו.

איך משתמשים

נכנסים לעמוד, מעלים תמונה בתיבת הקלט, ואם רוצים מוסיפים גם קובץ שמע לליווי. בוחרים את אורך הקטע הרצוי בין שנייה אחת ל־30 שניות באמצעות הסליידר ולוחצים על Submit.

זמן ההמתנה מושפע מכך שהתהליך כולל שני שלבי עיבוד נפרדים, קודם פענוח התמונה לטקסט ואחר כך יצירת השמע על מעבד גרפי T4 מבית אנבידיה. מעבר לכך, בעת הבדיקה הנוכחית העמוד מוגדר במצב מושהה, ולכן אי אפשר להריץ אותו ישירות בדפדפן בלי להפעיל אותו מחדש.

הרישיון

הפרויקט מפורסם תחת רישיון CC BY-NC 4.0 שמתיר שימוש לא מסחרי בלבד. משקלי המודל של MusicGen שייכים למטא, וקוד הספרייה שלהם מבוסס על רישיון MIT. תוכן שנוצר אינו מיועד לפעילות מסחרית.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗