GPT
I

img-to-music

רץ בדפדפן

fffiloniרישיון לא דווח2022-10-27

  • gradio

העלאת תמונה מייצרת קטע אודיו שמנסה להתאים לאווירה הוויזואלית שלה. הפתרון מיועד ליוצרי תוכן שרוצים לבדוק התאמה מוזיקלית מהירה בלי להלחין לבד.

  • הורדות בחודש
  • 986לייקים

מה זה

מעלים קובץ תמונה ומקבלים קטע מוזיקה לשמיעה ולהורדה, לצד תיאור הטקסט שחולץ מהתמונה. אפשר להגדיר אורך רצועה בין 20 ל־120 שניות, לבחור עוצמה בין שלוש רמות ולקבוע אם התוצאה תהיה טראק רגיל או לופ מחזורי.

מאחורי הקלעים התמונה עוברת דרך גרסת ספייס של CLIP-Interrogator לחילוץ תיאור מילולי. הטקסט מומר למונחים מוזיקליים, ואם מזינים מפתח של OpenAI נעשה עיבוד קצר נוסף באנגלית כדי לתרגם את התיאור לאווירה מוזיקלית, שלבסוף מתורגמת לצלילים בעזרת תיוג של Mubert.

מתאים ל

  • התאמת לופ רקע

    יצירת לופ אודיו מחזורי קצר לפי צילום סטילס או איור לפרויקט דיגיטלי.

  • חילוץ תיאור מוזיקלי

    המרת תמונה למונחים מוזיקליים תיאוריים באנגלית לצורך השראה.

  • בדיקת אווירה לפוסט

    קבלת קטע סאונד באורך מוגדר מראש עבור תמונה שמיועדת לפרסום.

איפה זה נופל

האפליקציה לא מלחינה בעצמה ישירות מפיקסלים, אלא רק מתווכת בין ניתוח תמונה לספריית צלילים קיימת. אם התיאור הוויזואלי מפספס את הכוונה, המוזיקה שתצא לא תהיה קשורה. מעבר לזה, כרגע יש שגיאת בנייה שמשביתה את הגישה בפועל.

שאלות
נפוצות

האם השימוש עולה כסף?

השימוש בממשק עצמו מוצע ללא תשלום. עם זאת, אם בוחרים להשתמש בחיבור ל־OpenAI כדי לשפר את תרגום התיאור, משלמים על המפתח הפרטי לפי התעריף שלהם. כרגע האפליקציה בכל מקרה תקועה בשגיאת בנייה.

כמה זמן לוקח לייצר קטע מוזיקה?

העיבוד דורש ניתוח תמונה, המרה לטקסט מוזיקלי והפקת קובץ אודיו שלם על מעבד בסיסי. התהליך מורכב מכמה שלבים עוקבים ולכן הוא עשוי לדרוש המתנה של דקה או יותר בכל הרצה. כרגע לא ניתן למדוד זאת בפועל בגלל השגיאה בשרת.

האם אפשר להריץ את זה על המחשב?

הקוד פתוח וכולל קובץ app.py שמשתמש ב־Gradio ובספריות פייתון סטנדרטיות. אפשר להוריד את הקבצים ולהריץ אותם מקומית, אך תצטרכו להגדיר את כל התלויות, חיבורי הרשת ומפתחות הגישה כדי לתקן את מה שגורם לשגיאת הבנייה הנוכחית.

במה זה שונה ממודל שמייצר מוזיקה ישירות?

אין כאן מודל אחד שממיר תמונה ישירות לקובץ קול. המערכת מחברת כמה כלים שונים: כלי אחד מזהה מה יש בתמונה, מודל שפה מתאים את המילים למונחים מוזיקליים, ותוכנה נפרדת שולפת צלילים מתאימים. החיבור הזה יוצר פער בין הדימוי החזותי לתוצאה הסופית.

איך משתמשים

נכנסים לממשק, גוררים תמונה לשדה הקלט, ולוחצים על כפתור הייצור. אם רוצים לדייק את התוצאה, פותחים את אפשרויות המוזיקה ומזינים מפתח פרטי של OpenAI, אף שאפשר להריץ גם בלעדיו. כרגע לא תצליחו להפעיל אותה בדפדפן כי השרת נמצא בשגיאת בנייה ולא מתפקד, אך במצב תקין המעבד הבסיסי גורם לתהליך לקחת זמן מה.

הרישיון

היוצר לא הגדיר רישיון רשמי בקוד. בלי רישיון ברור אין הרשאה משפטית להשתמש בקטעים שנוצרו לצרכים מסחריים, וגם לגבי הקבצים שאתם מעלים אין התחייבות כתובה לשמירה על פרטיות.

הרישיון המלא ב־Hugging Face ↗