GPT
O

OmniAvatar

רץ בדפדפן

alexnasaרישיון לא דווח2025-08-01

  • gradio

הכלי יוצר סרטוני אווטאר מדברים בסגנון טיקטוק ופודקאסטים מתוך תמונה וקובץ קול. הוא מיועד למי שרוצה להנפיש דמות על בסיס קטע שמע קיים.

  • הורדות בחודש
  • 292לייקים

מה זה

אתם מעלים תמונת פנים וקובץ אודיו, או בוחרים מתוך הדוגמאות המוכנות מראש שמציגות גברים ונשים עם הקלטות שונות. המערך מייצר סרטון וידאו שבו הדמות מונפשת ומדברת בהתאמה לקול. יש אפשרות להגדיר כיוון תצוגה ברזולוציית בסיס של 720 על 400, לקבוע מספר צעדי ריצה בין 4 ל־50, ולהשתמש בטקסט הנחיה מותאם לסצנה.

מאחורי הקלעים רץ שילוב כבד של מודלים. הבסיס נשען על Wan2.1-T2V-14B ומשקולות OmniAvatar-14B, לצד חילוץ מאפייני דיבור דרך wav2vec2 של פייסבוק, רכיבי F5-TTS, וספריית TeaCache להאצת שלבי העיבוד.

מתאים ל

  • הנפשת תמונות לפודקאסט

    יצירת קטע וידאו קצר של דמות מדברת מתוך הקלטת קול ותמונת פרופיל סטטית.

  • סרטוני טיקטוק קצרים

    הפקת קליפ מונפש של עד חמש שניות לרשתות חברתיות בלי צורך להצטלם.

  • בדיקת איכות סנכרון שפתיים

    הרצת דוגמאות מוכנות מראש לבחינת יכולות המודל Wan2.1 בהתאמת שפתיים לקול.

איפה זה נופל

זה לא כלי ליצירת סרטונים שלמים. ברירת המחדל חותכת קול מעבר ל־5 שניות, ומשקל המודל של 14 מיליארד פרמטרים עלול לגרום לזמני המתנה ארוכים מאוד בצעדים גבוהים. המרחב נרדם כשאין בו תנועה, ואי אפשר לדעת מראש אם דיבוב בעברית יסתנכרן טוב עם תנועות השפתיים שחולצו בעיקר מאנגלית.

שאלות
נפוצות

האם השימוש עולה כסף?

לא, הגישה בדפדפן חופשית על גבי תשתית החומרה השיתופית. יחד עם זאת, בגלל שהשרת במצב שינה, תצטרכו להמתין לעלייתו מחדש.

כמה זמן לוקח לייצר סרטון?

הזמן תלוי במספר הצעדים ובאורך האודיו, כאשר הממשק מחשב ומציג את הדקות הנדרשות לפני הריצה. אם השרת ישן, ההפעלה הראשונית תיקח כמה דקות נוספות.

האם אפשר להריץ את זה מקומית?

הקוד משתמש במודלים פתוחים שניתן להוריד מ־Hugging Face, כולל OmniAvatar-14B ו־Wan2.1. תצטרכו מחשב חזק מאוד עם כרטיס מסך בעל זיכרון גדול כדי להחזיק מודל של 14 מיליארד פרמטרים.

מה קורה לקבצים שמעלים?

הקבצים נשלחים לעיבוד על גבי השרת שמריץ את הממשק ונמחקים בפונקציות הניקוי של הקוד. למרות זאת, אין להעלות תמונות רגישות או הקלטות פרטיות לסביבה ציבורית.

איך משתמשים

טוענים תמונה וקול, בוחרים מספר צעדים ולוחצים על כפתור Avatar Me. ההרצה דורשת חומרת Zero-A10G, אבל המרחב נמצא כרגע במצב שינה, כך שהכניסה הראשונה דורשת המתנה של כמה דקות עד שהשרת יתעורר ויטען את המודלים הענקיים לזיכרון. הממשק כולל הגבלת ברירת מחדל של קבצי האודיו לעד 5 שניות כדי לחסוך זמן עיבוד, ומציג הערכת זמנים בדקות ובשניות לפי אורך הקלט שתספקו.

הרישיון

היוצר לא דיווח על רישיון מסודר בעמוד. המשמעות היא שאין הרשאה ברורה לשימוש מסחרי בתוצרים, ומומלץ להניח שכל קובץ שאתם מעלים לחומרה של האתר עשוי להישמר זמנית בשרת לצורך העיבוד.

הרישיון המלא ב־Hugging Face ↗