GPT
S

spectrogram-to-music

רץ בדפדפן

fffiloniרישיון לא דווח2022-12-15

  • gradio

הדגמת רשת שמייצרת קטעי אודיו דרך תמונות של ספקטרוגרמות בעזרת מודל דיפיוז'ן. היא מיועדת למי שרוצה להתנסות ביצירת סאונד מטקסט או לעבד קובץ קיים בלי להגדיר סביבת קוד.

  • הורדות בחודש
  • 400לייקים

מה זה

הרעיון פה נשען על המודל riffusion/riffusion-model-v1, שלוקח את ארכיטקטורת סטייבל דיפיוז'ן המוכרת מתמונות ומיישם אותה על ספקטרוגרמות של צליל. במקום לייצר גלי קול ישירות, המודל מצייר תמונה שמייצגת תדרים לאורך זמן, והקוד ממיר את הגרפיקה הזו בחזרה לקובץ שמע באמצעות הספרייה spectro.

הממשק נותן שני מסלולים. במסלול הראשון מקלידים הנחיית טקסט, מגדירים פרומפט שלילי ובוחרים משך זמן כדי לקבל קטע מוזיקלי מאפס. במסלול השני מעלים קובץ קול קיים ומריצים עליו העברת סגנון בעזרת צינור מסוג Img2Img, שמשנה את האופי של הצליל לפי התיאור המילולי.

בסיום התהליך מקבלים שני פלטים: תמונת הספקטרוגרמה שנוצרה ונגן אודיו לשמיעת התוצאה. הממשק כולל דוגמאות מובנות להרצה מהירה, אבל הדוגמאות אינן נשמרות במטמון ומחושבות מחדש בזמן אמת.

מתאים ל

  • יצירת דגימות סאונד

    הפקת אפקטים קצרים או רקעים מוזיקליים מהנחיות טקסט לפרויקטים אישיים.

  • העברת סגנון לאודיו

    העלאת קטע קיים והלבשת גוון צליל שונה עליו לפי תיאור מילולי.

  • בדיקת Riffusion

    הבנת האופן שבו דיפיוז'ן חזותי מתרגם תמונות תדרים לקובצי שמע בפועל.

איפה זה נופל

המודל הזה שוחרר בסוף 2022 ואינו מייצר מוזיקה מורכבת ברמת הפקה מודרנית. הספקטרוגרמות מומרות לצליל בשיטה שמשאירה רעשי רקע מתכתיים ועיוותים, במיוחד בקטעים ארוכים או כשיש עומס תדרים. בנוסף, מי שמצפה לעריכת סאונד נקייה יגלה שהשליטה במבנה השיר, במקצב המדויק או בכלים בודדים מוגבלת מאוד לעומת מודלים ייעודיים חדשים.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום כלשהו?

לא, השימוש בדף פתוח לחלוטין וללא עלות. אין צורך להזין אמצעי תשלום ואין הגבלה על כמות הניסיונות שאתם מריצים בדפדפן.

מה קורה עם קובצי האודיו שאני מעלה למערכת?

הקבצים נשלחים ישירות למרחב הריצה לצורך עיבוד הספקטרוגרמה בלבד. הם אינם נשמרים במאגר ציבורי קבוע, אבל מומלץ לא להעלות הקלטות רגישות לשרתים שיתופיים.

במה האפליקציה הזו שונה מהרצת המודל לבד בקוד?

היא עוטפת את המודל riffusion-v1 בממשק פשוט שחוסך התקנת ספריות כמו diffusers ו־torchaudio. התוצאה הטכנית זהה לחלוטין להרצה מקומית של אותו המודל.

האם אפשר להתקין ולהריץ אותה על המחשב שלי?

כן, הקוד בנוי מעל gradio ומשתמש בספריות פתוחות הזמינות לכולם. כדי להריץ אותה מקומית בקצב סביר תצטרכו כרטיס מסך מתאים של אנבידיה וסביבת פייתון מוגדרת.

איך משתמשים

העבודה כולה מתבצעת בדפדפן. מזינים טקסט בשדה ההנחיה, מחליטים אם להעלות קובץ אודיו, מכוונים את הסליידר של משך הזמן ולוחצים על כפתור השליחה. אין צורך בהתחברות או ביצירת חשבון.

הקוד רץ על חומרת zero-a10g שמקצה מעבד גרפי לפי דרישה. זה אומר שאם המעבד פנוי החישוב מתחיל מיד ומסתיים תוך שניות בודדות, אבל אם השרת עמוס ייתכן שתמתינו בתור קצר עד שהמשאב יוקצה לפעולה שלכם.

הרישיון

בדף הפרויקט לא דווח רישיון שימוש רשמי. המשמעות היא שאין הרשאה ברורה להשתמש בקטעי האודיו שנוצרו לצרכים מסחריים, ומבחינה משפטית הזכויות על התוצאות והקוד נשארות מעורפלות עד שהיוצר יגדיר זאת.

הרישיון המלא ב־Hugging Face ↗