GPT
S

Stable-Audio-Open-Zero

רץ בדפדפן

artificialguybrרישיון לא דווח2024-06-05

  • gradio

הכלי מייצר קטעי שמע ומוזיקה מתיאור טקסטואלי חופשי, ומתאים ליוצרי תוכן שצריכים דגימות סאונד קצרות בלי להסתבך בהתקנות. מקלידים הנחיה, מגדירים משך זמן, ומקבלים קובץ להאזנה.

  • הורדות בחודש
  • 473לייקים

מה זה

האפליקציה מקבלת תיאור טקסט של הסאונד שאתם רוצים להפיק, ופולטת קובץ שמע סטריאו באיכות של 44.1kHz. השליטה בתוצאה נעשית דרך כמה פרמטרים בסיסיים: סליידר לאורך הקטע שמאפשר לבחור עד 47 שניות, מספר שלבי דיפוזיה שנע בין 10 ל־150 עם ברירת מחדל של 100, ומדד CFG לקביעת רמת ההיצמדות להנחיה שלכם.

מאחורי הקלעים רץ המודל stable-audio-open-1.0 של חברת Stability AI, דרך ספריית stable-audio-tools הייעודית. הממשק מכיל דוגמאות מובנות להרצה, כך שאפשר לבדוק פרומפטים מוכנים מראש ולקבל מושג על יכולות המודל לפני שמנסחים בקשות מורכבות יותר בעצמכם.

מתאים ל

  • אפקטים קוליים לסרטונים

    יצירת רעשי רקע, צלילי אווירה או אפקטים קצרים של שניות בודדות לפי תיאור מדויק.

  • לופים ודגימות להפקה

    הפקת מקצבים בסיסיים, קטעי תופים או רקעים מוזיקליים כדי לשלב אותם בתוכנת עריכה.

  • בדיקת פרומפטים למודל

    ניסוי מהיר של ניסוחי טקסט והגדרות שלבי דיפוזיה ישירות בדפדפן בלי התקנה מקומית.

איפה זה נופל

ההגבלה הכי בולטת היא האורך המרבי, שמגיע ל־47 שניות בלבד ולא מעבר לזה. זה לא מיועד להפקת שירים שלמים עם מבנה מסודר. מעבר לזה, המודל פועל לפי הנחיות באנגלית בלבד, ופרומפטים בעברית לא יפיקו תוצאות הגיוניות.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה בדפדפן פתוחה ואינה דורשת תשלום או הזנת פרטי אשראי. כל עוד החומרה השיתופית זמינה, אפשר להפיק קטעים בחופשיות. אין צורך בהרשמה כדי להתחיל ליצור סאונד.

כמה זמן לוקח לייצר קטע שמע?

התהליך אורך לרוב בין שניות ספורות לחצי דקה, בהתאם לאורך הקטע ומספר שלבי הדיפוזיה שבחרתם. כרטיס המסך A10G מייצר את השמע בקצב סביר מאוד. אם יש עומס משתמשים ברשת, ייתכן עיכוב קל לפני תחילת העיבוד.

מה קורה לקבצים ולטקסטים שאני מזין?

הטקסט נשלח לשרת של הדמו כדי לבצע את החישוב, והאודיו מופק ישירות אל הדפדפן להאזנה והורדה. המערכת לא כוללת מנגנון שמירת פרויקטים אישי או היסטוריית שימוש מסודרת. כדאי להוריד את הקובץ מיד למחשב אם התוצאה מוצאת חן בעיניכם.

במה הדמו הזה שונה מהרצת המודל לבד?

מדובר במעטפת גרפית פשוטה סביב המודל של סטאביליטי, שחוסכת לכם צורך בכרטיס מסך חזק ובהתקנת סביבת פייתון. מצד שני, אתם מוגבלים להגדרות שהוטמעו בממשק, כמו מגבלת 47 השניות, ללא יכולת לשנות את קוד ההפקה בעצמכם.

איך משתמשים

נכנסים לממשק בגרדיו, כותבים את הפרומפט באנגלית, מכוונים את הסליידרים ולוחצים על כפתור ההרצה. החומרה שמוקצית כאן היא מאיץ מסוג Zero A10G שמופעל לפי דרישה, מה שאומר שהיצירה רצה מהר יחסית אבל ייתכן שתמתינו כמה שניות עד שהמשאב מתעורר אם המערכת הייתה במנוחה.

הרישיון

בעמוד האפליקציה לא דווח רישיון רשמי. כדאי לבדוק את תנאי השימוש המקוריים של המודל stable-audio-open-1.0 לפני שמשתמשים בקבצים שנוצרו בפרויקטים מסחריים.

הרישיון המלא ב־Hugging Face ↗