GPT
A

AnyTalker

רץ בדפדפן

C4G-HKUSTרישיון לא דווח2025-12-05

  • gradio

הכלי מפיק סרטוני דיבור מונפשים שבהם מספר דמויות מגיבות ומדברות יחד מתמונה בודדת. הוא מיועד ליוצרי וידאו וחוקרים שרוצים לתזמן שיחה בין כמה דוברים מקבצי שמע שונים.

  • הורדות בחודש
  • 76לייקים

מה זה

מעלים תמונת מקור אחת ומזינים קבצי שמע נפרדים לכל דמות, משמאל לימין, עד שלושה אנשים בממשק. לצד האודיו אפשר להוסיף הנחיית טקסט, הנחיה שלילית ולהגדיר את אופן סידור השמע. המערכת מזהה את הפנים ומפיקה סרטון וידאו ברזולוציה של 832 על 480 בפורמט H.264, שבו הפיות וההבעות מתאימים לקול.

מאחורי הקלעים רץ שילוב של מודל הבסיס Wan2.1-Fun-V1.1 בגרסת 1.3B, מקודד השמע wav2vec2-base-960h, ומשקלי AnyTalker-1.3B של צוות הפיתוח. אליהם מתווספים מודלים כמו LivePortrait, Google umt5-xxl וזיהוי פנים עם InsightFace. הדוגמאות המובנות מציגות סרטונים של אדם בודד ושני אנשים מדברים זה לצד זה.

מתאים ל

  • הנפשת שיחה בין שתי דמויות

    חיבור תמונה משותפת עם שני קבצי קול נפרדים כדי ליצור וידאו שבו שני הדוברים עונים זה לזה ברצף.

  • יצירת קריינות של אדם בודד

    העלאת תמונת פורטרט בודדת וקובץ שמע של עד ארבע שניות לקבלת סרטון דיבור מהיר בתצוגה מקדימה.

  • בדיקת אינטראקציה מחקרית

    הערכת תזמון הבעות הפנים של מספר דוברים מול מאגר המבחן הרשמי שפרסמו החוקרים ביוטיוב.

איפה זה נופל

ההדגמה הנוכחית לא פועלת בגלל שגיאת זמן ריצה בעמוד. המודל הזמין להורדה הוא גרסת 1.3B בלבד, שאומנה על נתוני אדם יחיד, בעוד שגרסת 14B שמציגה אינטראקציה מורכבת יותר טרם שוחררה. בנוסף, חיתוך האודיו במצב המהיר מוגבל לארבע שניות, ואיכות הפלט נעצרת ב־480p ללא תמיכה ברזולוציות גבוהות.

שאלות
נפוצות

האם השימוש בהדגמה בדפדפן עולה כסף?

הגישה לעמוד אינה דורשת תשלום, והיא פתוחה לשימוש ציבורי. עם זאת, נכון לעכשיו מופיעה בעמוד שגיאת הרצה והוא אינו מתפקד. מי שרוצה להשתמש בכלי צריך להוריד את הקוד ולהריץ אותו בחומרה משלו.

כמה זמן לוקח לייצר סרטון?

במצב המהיר ההקצאה היא עד שתי דקות על המעבד הגרפי לסרטון של ארבע שניות. במצב איכות הזמן מחושב לפי דקה של עיבוד מקדים ועוד שלוש שניות לכל שניה של וידאו כפול מספר הצעדים. בפועל, בגלל התקלה הנוכחית בדף אי אפשר לייצר כרגע סרטונים ישירות ברשת.

אפשר להריץ את המערכת על מחשב אישי?

אפשר להוריד את הקוד מגיטהאב ואת המשקלים מ־Hugging Face להתקנה מקומית. כדי להריץ נדרשת סביבת לינוקס, תמיכה ב־FFmpeg עם מקודד x264 וכרטיס מסך שמריץ מודלים מסוג Wan2.1. ההרצה המקומית מאפשרת לעקוף את מגבלות הזמן והשגיאה שיש בעמוד.

במה ההדגמה בעמוד שונה מהמודל המלא?

העמוד מריץ את גרסת ה־1.3B בלבד, שמוגבלת לתמונה יחידה ורזולוציית 480p. תוצאות איכותיות יותר של מודל ה־14B מופיעות בעמוד הפרויקט אך טרם שוחררו. בנוסף, בממשק יש חלוקה מובנית לעד שלושה דוברים וזמני ריצה קבועים מראש.

איך משתמשים

בוחרים בין שני מצבי הפעלה. מצב מהיר מייצר תצוגה מקדימה של עד ארבע שניות בשמונה צעדי דה-נויז ומוגבל ל־120 שניות שימוש במאיץ. מצב איכות מאפשר לכוון את מספר הצעדים עם ברירת מחדל של 25 צעדים, ומקצה זמן לפי נוסחה של 60 שניות עיבוד מקדים ועוד שלוש שניות לכל צעד כפול אורך הסרטון. החומרה המוגדרת היא שרת מסוג zero-a10g, אך כרגע הדף מדווח על RUNTIME_ERROR כך שלא ניתן להריץ את ההפקה בדפדפן.

הרישיון

הפרויקט פורסם ללא רישיון מוגדר בקבצים. בהיעדר תנאי שימוש ברורים, אין אישור לשימוש מסחרי בקוד או במשקלי המודל, ולא ברור מה הסטטוס המשפטי של התוכן שמעלים או מפיקים.

הרישיון המלא ב־Hugging Face ↗