GPT
A

audioldm-text-to-audio-generation

רץ בדפדפן

haoheliubigscience-openrail-m2023-01-30

  • gradio

מזינים תיאור טקסטואלי באנגלית ומקבלים קובץ שמע קצר מבוסס מודל דיפוזיה. הכלי מיועד למי שמחפש אפקטים קוליים, צלילי רקע או בדיקה מהירה של טכנולוגיית סאונד מבוססת טקסט.

  • הורדות בחודש
  • 814לייקים

מה זה

אתם כותבים פרומפט בשפה חופשית, ויכולים להוסיף גם טקסט שלילי כדי לסנן מאפיינים לא רצויים. המערכת מחזירה וידאו עם תצוגת גל קול שמנגן את הצליל שהופק בתדר של 16000 הרץ, על גבי תמונת רקע קבועה.

מאחורי הממשק רץ צינור העבודה של AudioLDM שמבוסס על המודל cvssp/audioldm-m-full, לצד מודל CLAP של sanchit-gandhi שמעבד את הטקסט ומדרג את התוצאות. המנגנון נשען על עקרונות של דיפוזיה לטנטית בדומה ל־Stable Diffusion, אך מתורגם ליצירת ספקטרוגרמות של אודיו במקום תמונות.

מתאים ל

  • הפקת אפקטים קוליים

    יצירת רעשי רקע קצרים, צעדים, רוח או פגיעות עבור משחקים ועריכות וידאו.

  • בדיקת פרומפטים לסאונד

    השוואה מהירה בין תיאורים שונים בעזרת מודל הדיפוזיה וקביעת אורך הצליל.

  • מחקר מודלי אודיו

    בחינת יכולות השילוב בין מודל CLAP לצינור היצירה של AudioLDM.

איפה זה נופל

הבעיה המרכזית כרגע היא שההדגמה נמצאת במצב שגיאת ריצה, ולכן אי אפשר להפיק בה צלילים חדשים ישירות בדפדפן בלי שהיוצר יאתחל אותה מחדש. מעבר לכך, הממשק דורש קלט טקסטואלי בלבד ומחזיר שגיאה אם משאירים את התיבה ריקה, כך שאין אפשרות להעלות קובץ שמע לשינוי או להרחבה. האורך המרבי של קטע מוגבל לעשר שניות בלבד, וקצב הדגימה עומד על 16 קילוהרץ, מה שלא מתאים להפקות שדורשות נאמנות צליל גבוהה במיוחד.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

הגישה לממשק באתר אינה כרוכה בתשלום ואינה דורשת הזנת פרטי אשראי. היא מופעלת על תשתית שיתופית עם חומרת L4. עם זאת, נכון לעכשיו היא מציגה שגיאת מערכת ואינה פעילה.

האם אפשר להריץ את הכלי מקומית על המחשב?

כן, הקוד מסתמך על חבילות diffusers ו־transformers שזמינות בקוד פתוח. אפשר למשוך את המשקולות של המודלים המצוינים בקוד ולהריץ אותם בסביבת פייתון פרטית. תצטרכו כרטיס מסך מתאים עם זיכרון מספק כדי לעבד את הדיפוזיה.

מה האורך המרבי של הצליל שניתן להפיק?

הממשק מאפשר לבחור משך זמן של עד עשר שניות בלבד באמצעות הסליידר. הבחירה נעשית בקפיצות של שתיים וחצי שניות, החל מ־2.5 שניות. אי אפשר לייצר קטעים רציפים ארוכים יותר בריצה בודדת.

האם יש תמיכה בהזנת עברית?

הקוד טוען מעבד טקסט ומודל CLAP שאומנו באנגלית על תיאורי סאונד. הזנת הנחיות בעברית עלולה להניב תוצאות לא רלוונטיות או ריקנות. כדי לקבל תוצאה מדויקת יש לתאר את הצליל באנגלית.

איך משתמשים

מקלידים את תיאור הצליל הרצוי בתיבה ולוחצים על Submit. אם רוצים שליטה מדויקת יותר, פותחים את תפריט ההגדרות וקובעים את אורך הקטע בין 2.5 ל־10 שניות בקפיצות של 2.5, מגדירים סיד קבוע, משנים את ערך ה־guidance scale או מייצרים מספר מועמדים במקביל לבחירה אוטומטית. העיבוד מבוצע על מאיץ גרפי בודד מסוג L4, אבל אין צורך להתקין דבר או להירשם כדי לגשת לממשק.

הרישיון

הפרויקט מופץ תחת רישיון bigscience-openrail-m. הרישיון מאפשר שימוש חופשי ומחקר, אך מטיל הגבלות על שימושים פוגעניים, הפצת מידע כוזב או פעולות שמפרות חוק. הוא חל על השימוש במודל ובתוצרים שלו.

הרישיון המלא ב־Hugging Face ↗