GPT
A

audioldm2-text2audio-text2music

רץ בדפדפן

haoheliuרישיון לא דווח2023-08-04

  • gradio

הדגמה שמייצרת קטעי קול ומוזיקה מתיאור טקסטואלי חופשי ישירות בדפדפן. היא מיועדת למי שרוצה לבדוק יכולות של יצירת אודיו בלי לכתוב שורת קוד.

  • הורדות בחודש
  • 307לייקים

מה זה

כותבים תיאור באנגלית של הצליל או המוזיקה שרוצים לשמוע, ויכולים להוסיף גם הנחיה שלילית של מה לא לכלול. המערכת מחזירה סרטון שמציג ויזואליזציה של גל הקול לצד האודיו שנוצר, כך שקל להאזין ולשתף אותו.

מאחורי הקלעים רץ המודל cvssp/audioldm2 באמצעות ספריית Diffusers. הממשק מאפשר לשלוט באורך הקטע שנע בין 5 ל־15 שניות, לקבוע סיד ליצירה עקבית, לשנות את מידת ההיצמדות לטקסט ולבחור כמה מועמדים לייצר בכל הרצה. בעמוד מוגדרות גם דוגמאות מוכנות מראש שמאפשרות לבדוק תוצאות בלי להזין פרומפט מאפס.

מתאים ל

  • יצירת אפקטים קוליים

    הפקת רעשי רקע, צעדים, אווירה וצלילים קצרים לסרטונים או משחקים מתוך תיאור טקסטואלי.

  • בדיקת רעיונות למוזיקה

    קבלת קטעי נגינה קצרים של עד 15 שניות כדי לבדוק כיוונים מוזיקליים או סגנונות ספציפיים.

  • המחשת יכולות המודל

    בחינת האופן שבו ארכיטקטורת AudioLDM 2 מתרגמת פרומפטים מורכבים לגלי קול בפועל.

איפה זה נופל

המגבלה הכי גדולה כרגע היא טכנית: האפליקציה תקועה בשגיאת ריצה ולא עובדת. מעבר לזה, המודל מוגבל ליצירת קטעים קצרים בלבד באורך של עד 15 שניות, מה שלא מתאים ליצירת טרקים שלמים או קטעי דיבוב ארוכים. הממשק מחזיר וידאו ולא קובץ שמע ישיר כמו MP3 או WAV, כך שמי שצריך רק סאונד יצטרך לחלץ אותו בעצמו.

שאלות
נפוצות

האם האפליקציה עובדת כרגע בדפדפן?

לא, כרגע הדף מדווח על RUNTIME_ERROR. עד שהמפתח לא יעדכן את הקוד או את הסביבה, אי אפשר להריץ דרכה יצירות חדשות. אפשר רק לשכפל אותה לחשבון אישי ולנסות להרים אותה עצמאית.

האם השימוש בה כרוך בתשלום?

הגישה לעמוד בהאגינג פייס פתוחה לגמרי וחינמית. אין צורך לשלם על הרצות כל עוד משתמשים בממשק הציבורי. אם תחליטו לשכפל את החלל לחומרה ייעודית משלכם בתשלום, תחויבו לפי תעריפי הפלטפורמה.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד מסתמך על חבילת diffusers והמודל cvssp/audioldm2 שזמין להורדה חופשית. אפשר להתקין את הספריות המתאימות בפייתון ולהריץ את כל הצינור אצלכם. תצטרכו כרטיס מסך מתאים עם זיכרון מספק כדי לקבל ביצועים סבירים.

במה שונה ההדגמה הזאת מהרצת המודל ישירות בקוד?

הממשק כאן עוטף את הצינור של AudioLDM 2 בטפסים גרפיים של Gradio וממיר את האודיו לווידאו עם גל קול. בקוד ישיר מקבלים שליטה מלאה בפרמטרים, אפשרות לייצר ישירות קובצי שמע נקיים, ואין תלות בשגיאות של השרת שמארח את ההדגמה.

איך משתמשים

מקלידים את הפרומפט בתיבת הטקסט, פותחים את תפריט ההגדרות אם רוצים לשנות אורך או סיד, ולוחצים על Submit. התוצאה מופיעה כקובץ וידאו עם תצוגת גל קול. ההרצה אמורה להסתמך על מעבד גרפי מסוג a10g-small שמספק עיבוד מהיר יחסית, אך בפועל האפליקציה נמצאת במצב של שגיאת ריצה (RUNTIME_ERROR), כך שכרגע לא ניתן להפיק ממנה אודיו חדש ישירות בדפדפן.

הרישיון

הרישיון של היישום לא דווח בעמוד שלו. כשאין רישיון מוגדר, לא ברור אם מותר להשתמש בצלילים שנוצרו לצרכים מסחריים או לשלב אותם בפרויקטים פומביים, ולכן מומלץ להתייחס לתוצרים ככאלה שמיועדים לבדיקה ולמחקר בלבד.

הרישיון המלא ב־Hugging Face ↗