GPT
S

Sound-AI-SFX

רץ בדפדפן

fantaxyרישיון לא דווח2024-12-08

  • gradio

הכלי מייצר אפקטים קוליים וקטעי אודיו קצרים מתוך תיאור טקסט חופשי. הוא מתאים ליוצרי וידאו, מפתחי משחקים ועורכי פודקאסטים שצריכים סאונד מותאם אישית.

  • הורדות בחודש
  • 328לייקים

מה זה

כותבים תיאור טקסטואלי של הצליל המבוקש ומקבלים קובץ אודיו בפורמט WAV באיכות של 44.1kHz, באורך של שנייה עד 30 שניות. הממשק מאפשר לקבוע גם את מספר צעדי הדגימה בין 10 ל־100 ואת מידת ההיצמדות לטקסט בסקאלה של 1 עד 10.

מאחורי הקלעים רץ המודל TangoFlux, שמתבסס על טכניקת Flow Matching ואופטימיזציית העדפות לפי דירוג CLAP, יחד עם שימוש במודלים מקודדי טקסט מבוססי טרנספורמר כמו T5. ברשימת התלויות מופיעים גם מודלים של Stable Diffusion ו־Tango2, אך המנוע הראשי המופעל בסקריפט ליצירת האודיו הוא TangoFluxInference.

בעמוד מובנות מעל 20 דוגמאות מוכנות מראש. הדוגמאות מציגות מנעד רחב שכולל רעשי טבע כמו גלי ים וגשם, קולות בעלי חיים, פעולות אנושיות כמו צחוק או שריקה, ורעשי מכונות מורכבים.

מתאים ל

  • אפקטים לפיתוח משחקים

    יצירת רעשי סביבה מותאמים, צעדים, פיצוצים או קולות מנוע באורך של עד 30 שניות עבור שלבים במשחק.

  • עיצוב פסקול לווידאו

    הפקת רעשי רקע ייחודיים כמו גשם על חלון או גלי ים כדי לסגור חורים בעריכת סרטים וסרטונים.

  • תוספות סאונד לפודקאסטים

    שילוב אפקטים קוליים נקודתיים כמו צחוק, שריקה או צלצול לצורך מעברים בין קטעים בפרק.

איפה זה נופל

האפליקציה מוגבלת לייצור קטעים של עד 30 שניות בלבד, כך שהיא אינה מתאימה ליצירת רצועות מוזיקה ארוכות או ליווי רקע שלם. מעבר לכך, כל הטקסטים וההגדרות במקור באנגלית, ולא מצוינת שום תמיכה בהבנת תיאורים בעברית. ניסוחים מורכבים מדי עלולים לייצר רעש דיגיטלי במקום הפרדה ברורה בין שכבות הצליל.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הממשק פתוח לשימוש חופשי בדפדפן דרך Hugging Face. אין צורך בהזנת פרטי תשלום כדי להפיק צלילים.

האם הטקסטים שמוזנים נשמרים?

העיבוד נעשה על שרתי הענן שמריצים את המרחב, והקוד שומר זמנית קבצי WAV כדי שתוכלו להאזין להם ולהוריד אותם בדפדפן. אין כאן מנגנון של חשבון משתמש פרטי, לכן עדיף לא להזין טקסטים רגישים.

כמה זמן לוקח לייצר קטע אודיו?

בזכות הרצה על גבי מאיץ A10G וטכנולוגיית Flow Matching, התהליך לוקח שניות בודדות לכל קובץ. משך הזמן המדויק תלוי במספר הצעדים שתבחרו ובאורך הקטע שביקשתם.

האם אפשר להריץ את הכלי מקומית על המחשב?

כן, הקוד הציבורי מבוסס על פייתון, Diffusers ו־TangoFluxInference. כדי להריץ אותו אצלכם תצטרכו סביבת עבודה מתאימה עם תמיכה ב־CUDA וכרטיס מסך שמסוגל להתמודד עם המודל.

איך משתמשים

נכנסים לממשק, מקלידים תיאור בשדה הטקסט, מכוונים את שלושת הסליידרים של הצעדים, ההיצמדות והאורך, ולוחצים על כפתור יצירת האודיו. לא צריך להירשם או לשלם כדי להריץ בדיקה ישירות בדפדפן.

הקוד משתמש בהקצאת חומרה מסוג zero-a10g דרך מנגנון spaces.GPU. זה אומר שהעיבוד עצמו רץ על מעבד גרפי A10G וגוזר זמני תגובה מהירים, אך בעומס ייתכן שתמתינו כמה שניות עד שהחומרה תתעורר ותתפנה עבור הבקשה.

הרישיון

הרישיון של המרחב עצמו לא דווח ולא צוין בקוד. ללא רישיון שימוש מוגדר, לא ברור אם מותר להשתמש בקבצי האודיו שנוצרו בפרויקטים מסחריים או להפיץ אותם מחוץ לשימוש אישי.

הרישיון המלא ב־Hugging Face ↗