GPT
T

ThinkSound — הדגמה

קוד פתוח

FunAudioLLMapache-2.02025-06-30

  • gradio
  • mcp-server

הדגמה שמייצרת סאונד ומצמידה אותו לקובצי וידאו אילמים לפי תיאור טקסטואלי מפורט. מתאימה ליוצרי וידאו שרוצים להלביש אפקטים קוליים מותאמים אישית על קליפ קיים.

  • 28.2 GBמשקל הקבצים
  • הורדות בחודש
  • 321לייקים

מה זה

אתם מעלים קובץ וידאו, ומקבלים חזרה סרטון שבו האודיו שנוצר כבר מוטמע ומסונכרן עם התמונה. הממשק כולל שני שדות טקסט אופציונליים: תיאור קצר, ותיאור מורחב במבנה של שרשרת מחשבה שבו אפשר לפרט במדויק את שכבות הצליל, הרעשים ברקע והקצב.

מאחורי הקלעים רץ שילוב של מספר מודלים. עיבוד הווידאו נשען על MetaCLIP לחילוץ מאפיינים חזותיים לצד Synchformer לסנכרון, בזמן שדחיסת האודיו ופענוחו נעשים דרך EnCodec של פייסבוק ב־32 קילוהרץ ו־VAE ייעודי. יצירת האודיו עצמה מתבססת על משקלי ThinkSound וסדרת מודלי Flan-T5 שרצים בקוד.

מתאים ל

  • הוספת פולי לווידאו אילם

    יצירת רעשי רקע, צעדים ומגע בחפצים לפי פירוט מדויק של הפעולות שמופיעות בסרטון.

  • סאונד לאפקטים ואנימציה

    הלבשת צלילים מותאמים לסרטוני הדמיה, תנועת מכונות או פיצוצים ללא צורך בהקלטות שטח.

  • אווירה ורעשי סביבה

    הגדרת שכבות שמע מורכבות כמו רעש תעשייתי, חדרים סגורים או הדהוד של לילה פתוח.

איפה זה נופל

הבעיה העיקרית כרגע היא שההדגמה מושהית ולא זמינה לעיבוד קבצים חדשים. מעבר לכך, הקוד משתמש בגרסה מופחתת של המודל לפי קובץ המשקלים thinksound_light.ckpt, כך שהביצועים בהדגמה אינם מייצגים בהכרח את המודל המלא. איכות התוצאה תלויה גם בכתיבת תיאור מפורט ומדויק באנגלית, וסרטונים עם התרחשויות מהירות עלולים לסבול מחוסר דיוק בסנכרון.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה בחינם?

כן, השימוש בהדגמה בחינם לחלוטין וללא צורך בהרשמה או כרטיס אשראי. יחד עם זאת, כרגע היא במצב מושהה ולכן אי אפשר להריץ עליה קבצים חדשים עד שהיוצרים יפעילו אותה שוב.

כמה זמן לוקח לייצר אודיו לסרטון?

זמן העיבוד מושפע מאורך הווידאו ומהחומרה המוקצית, מסוג A10G שמופעלת לפי דרישה. אם ההדגמה אינה פעילה או שהמעבד קר, יש להמתין לעליית השרת לפני תחילת העבודה.

האם אפשר להריץ את המערכת על מחשב מקומי?

כן, הקוד מבוסס על ספריות סטנדרטיות כמו PyTorch ו־Gradio עם רישיון Apache 2.0. תצטרכו להוריד את המשקלים מ־Hugging Face ולהחזיק כרטיס מסך מתאים להרצת המודלים.

במה ההדגמה שונה מהמודל המלא?

האפליקציה טוענת קובץ משקלים בשם thinksound_light.ckpt, שנועד לפעולה מהירה יותר ברשת על חשבון עומק המודל המלא. בנוסף, הדוגמאות בממשק נשמרות במטמון ולכן מוצגות מיד, בניגוד לקבצים שאתם מעלים.

איך מריצים

גוררים סרטון לתיבת הווידאו, כותבים תיאור חופשי או בוחרים באחת מארבע הדוגמאות המוכנות, ולוחצים על הפעלה. המערכת מוגדרת על חומרת Zero-A10G, מה שאומר שהמעבד הגרפי מתעורר לפי דרישה ועשוי להוסיף זמן המתנה קצר בהתחלה. עם זאת, נכון לעכשיו סטטוס האפליקציה מוגדר כמושהה, כך שלא ניתן להריץ עליה יצירה בפועל ישירות מהדפדפן.

pip install -U huggingface_hub
hf download FunAudioLLM/ThinkSound

הרישיון

הקוד וההדגמה מפורסמים תחת רישיון Apache 2.0 המאפשר שימוש חופשי ושינוי, כולל שימוש מסחרי. יש לשים לב שהחומרים שאתם מעלים עוברים דרך השרתים של Hugging Face וחשופים לתנאי השימוש של השירות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗