GPT
V

Video-to-SoundFX

רץ בדפדפן

fffiloniרישיון לא דווח2024-02-19

  • gradio

מעלים קטע וידאו ומקבלים אפקט קול שמותאם למה שקורה בצילום. הכלי מתאים למי שרוצה להדביק במהירות סאונד מבוסס בינה מלאכותית על קטעים קצרים בלי לעצב אותו ידנית.

  • הורדות בחודש
  • 207לייקים

מה זה

אתם מעלים קובץ וידאו ובוחרים מודל ליצירת שמע מתוך רשימה שכוללת את Tango, Tango 2, MAGNet, AudioLDM-2, AudioGen או Stable Audio Open. הקוד מנתח את התמונה באמצעות עיבוד וידאו עם OpenCV וספריות תואמות, מחלץ תיאור טקסטואלי של הסצנה, ומעביר את הפרומפט שנוצר ישירות אל מחולל השמע שבחרתם.

בסיום התהליך מופיעים על המסך הטקסט שמתאר את הסצנה, קובץ האודיו שנוצר, ונגן וידאו שבו פס הקול החדש כבר מוטמע בתוך הקובץ המקורי שלכם. הדוגמאות בממשק כוללות סרטוני רכבות, דרקון בחגיגות ראש השנה הסיני ונוף של ביג סר, כולם מוגדרים מראש להרצה על Tango או AudioLDM-2 כדי להדגים התאמה בין תנועה חזותית לרעשי רקע.

מתאים ל

  • הוספת רעשי רקע לסרטונים

    יצירה אוטומטית של רעשי אווירה כמו רכבת נוסעת או רחוב סואן מתוך קובץ וידאו אילם.

  • השוואת מודלים של שמע

    בדיקת אותה סצנה מול מנועים שונים כמו Tango ו־MAGNet כדי לראות מי מהם מייצר תוצאה מדויקת יותר.

  • דיוק אפקט לפי עריכת טקסט

    קבלת תיאור בסיסי של הסרטון, תיקון הפרומפט ידנית ויצירה חוזרת של פס הקול בלי לצאת מהעמוד.

איפה זה נופל

הכלי תלוי בזמינות של ממשקי API חיצוניים עבור כל מודל סאונד, והקוד מציג הודעות שגיאה מפורשות כשאחד מהם אינו מוכן לפעולה. בנוסף, הדוגמאות המוכנות לא נשמרות במטמון ודורשות הרצה מלאה. היות שהסאונד מופק על בסיס תיאור טקסט בודד שנחתך לפי סימני פיסוק, תזמון מדויק של אפקטים נקודתיים בתוך הסרטון עלול לפספס לחלוטין.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

לא, השימוש בעמוד פתוח ללא עלות ואין דרישה להזנת פרטי תשלום. כל המודלים הזמינים בתפריט נגישים ישירות דרך הדפדפן.

למה מופיעה לי הודעת שגיאה שהמודל לא מוכן?

האפליקציה פונה ל־Spaces אחרים כדי לייצר את הסאונד בפועל. אם המרחב של מודל מסוים כבוי או עמוס, מופיעה שגיאה שמבקשת לנסות שוב בעוד מספר דקות.

איך אפשר לשפר סאונד שלא התאים לסרטון?

אחרי ההרצה הראשונה תיבת תיאור הסצנה הופכת לפעילה לעריכה. אפשר לשנות בה את המילים וללחוץ על הכפתור שמריץ מחדש את המודל לפי התיאור המעודכן.

איך משתמשים

גוררים וידאו לתיבת ההעלאה, בוחרים את המודל המבוקש ולוחצים על Submit. אם התיאור המילולי שהופק לא מדויק, אפשר לערוך את הטקסט בתיבת התיאור וללחוץ על כפתור הייצור מחדש כדי לקבל סאונד מתוקן. האפליקציה רצה על חומרת מעבד בסיסית, מה שאומר שהעיבוד עלול לקחת זמן, במיוחד כשהיא פונה דרך ממשקי API חיצוניים לחללים אחרים שעלולים להיכנס להמתנה.

הרישיון

היוצר לא ציין רישיון שימוש בקוד של האפליקציה. ללא רישיון מוגדר אי אפשר לדעת אם מותר להשתמש בתוצרים לצרכים מסחריים, וזכויות השימוש נקבעות למעשה לפי תנאי המודל הספציפי שבו בחרתם לייצר את השמע.

הרישיון המלא ב־Hugging Face ↗