GPT
L

victor/LongCat-Video-Avatar-1.5

רץ בדפדפן

victorרישיון לא דווח2026-05-22

  • gradio

הכלי מייצר סרטון דיבור באורך חמש שניות מתוך תמונה אחת וקובץ שמע. הוא מתאים למי שרוצה לבדוק הנפשת דמויות וסנכרון שפתיים בלי להתקין סביבת פיתוח כבדה.

  • הורדות בחודש
  • 313לייקים

מה זה

אתם מעלים תמונת פנים, קובץ שמע של דיבור וכותבים הנחיית טקסט קצרה. המערכת מחזירה סרטון וידאו קצר עם תנועת שפתיים מותאמת לצליל. בממשק יש דוגמאות מוכנות מראש שממחישות את היכולות על דמויות מגוונות, כולל דמות פוטוריאליסטית, לוחם אורק ודמות מאוירת, יחד עם קובצי קול תואמים.

מאחורי הקלעים רץ המודל LongCat-Video-Avatar 1.5 של חברת Meituan. כדי שהעיבוד יהיה מהיר מספיק בדפדפן, הוא משתמש בגרסה מכווצת של מודל הדיפוזיה ברמת שמונה ביט, יחד עם מודול זיקוק של שמונה צעדים ומקודדי טקסט ווידאו תומכים.

מתאים ל

  • הנפשת תמונות סטילס

    יצירת קליפ דיבור קצר מתמונת פנים בודדת וקובץ שמע של חמש שניות.

  • דיבוב דמויות מאוירות

    בדיקת סנכרון שפתיים על איורים, מפלצות ודמויות פנטזיה לפי קול מוקלט.

  • בדיקת מודל LongCat

    התנסות מעשית בביצועי המודל המכווץ בלי צורך להוריד משקלים כבדים למחשב.

איפה זה נופל

התוצר מוגבל לסרטונים באורך של חמש שניות בלבד, כך שלא ניתן להפיק כאן סרטונים ארוכים ברצף. בנוסף, קובצי שמע בעייתיים עלולים לגרום לשגיאת עיבוד בקוד ולעצור את הריצה. הדוגמאות המוכנות מראש שמורות במטמון ורצות מיד, מה שמייצר תחושה שהכלי מהיר בהרבה ממה שהוא באמת כשמעלים קבצים חדשים לחלוטין. רזולוציית 720p דורשת משאבים רבים יותר ועלולה להיכשל תחת מגבלות הזיכרון של המאיץ.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

הגישה פתוחה בדפדפן ואינה דורשת תשלום. השימוש נשען על מכסות זמן עיבוד של תשתית ZeroGPU, ולכן שימוש אינטנסיבי עלול להיחסם זמנית.

כמה זמן לוקח לייצר סרטון?

הדוגמאות המוכנות נטענות מיד כי הן שמורות במטמון. יצירת סרטון חדש מקבצים שאתם מעלים לוקחת זמן ממושך יותר ותלויה בעומס על מאיץ ה־A10G וברזולוציה שנבחרה.

מה קורה לקבצים שאני מעלה?

התמונות וקטעי הקול מועלים לשרת כדי לבצע את תהליך ההסקה וסנכרון השפתיים. הם נשמרים בספריות זמניות בזמן הריצה, אך מאחר שהרישיון והתנאים לא צוינו במפורש, עדיף לא להעלות מידע רגיש.

האם אפשר להריץ את זה על המחשב שלי?

הקוד והמשקלים זמינים בקוד פתוח בקישורים המצורפים בממשק. כדי להריץ אותם מקומית תצטרכו כרטיס מסך חזק, התקנת ספריות מתאימות והורדת קובצי המודל של Meituan.

איך משתמשים

בצד אחד מעלים תמונה ומקליטים או גוררים קובץ שמע, בוחרים רזולוציה בין 480p לבין 720p, מגדירים מספר סיד אם רוצים לשלוט באקראיות, ולוחצים על כפתור ההפקה. הממשק כולל גם בחירה של מצב קולי והגדרות האצה שמייעלות את זמן הריצה.

העיבוד מתבצע על מאיץ גרפי מסוג A10G דרך תשתית ZeroGPU. המשמעות היא שאין צורך בכרטיס מסך חזק במחשב שלכם, אך בזמני עומס אתם עלולים להמתין בתור לפני שהעיבוד מתחיל. פס התקדמות בממשק מציג את קצב הריצה בזמן אמת עד לקבלת קובץ הווידאו המוכן.

הרישיון

הרישיון של המרחב לא דווח. מומלץ להיזהר משימוש מסחרי בתוצרים, שכן תנאי השימוש במודל הבסיס של Meituan ובמודלים הנלווים אינם מפורטים בעמוד. התמונות וקטעי הקול שאתם מעלים מועברים לשרתי התשתית לצורך עיבוד.

הרישיון המלא ב־Hugging Face ↗