GPT
E

modelscope/ExVideo-SVD-128f-v1

רץ בדפדפן

modelscopeapache-2.02024-06-26

  • gradio

הפיכת תמונות בודדות לסרטוני וידאו קצרים ישירות בדפדפן. מתאים למי שרוצה לבדוק הנפשה מבוססת תמונה בלי להתקין סביבות עבודה כבדות במחשב.

  • הורדות בחודש
  • 111לייקים

מה זה

מעלים תמונה סטטית בפורמט רגיל ומקבלים קובץ וידאו מונפש. מאחורי הקלעים הקוד משתמש בספריית diffsynth ומריץ שילוב של שני מודלים, stable-video-diffusion-img2vid-xt יחד עם ExVideo-SVD-128f-v1, שנועדו לייצר רצף תנועה מתוך תמונת מקור אחת.

הממשק כולל תפריט אפשרויות מתקדמות עם כמה פרמטרים טכניים שאפשר לכוונן לפני הריצה. אפשר לשלוט שם בערך ה־seed כדי לשחזר תוצאות, להגדיר את רמת התנועה שרוצים לסנתז דרך motion bucket id בין 0 ל־127, ולקבוע את מספר צעדי הדגימה מ־1 עד 50, כשברירת המחדל עומדת על 25 צעדים. יש בממשק גם דוגמאות מובנות שאפשר להריץ ישירות כדי לראות איך המערכת מגיבה לתמונות קיימות.

מתאים ל

  • הנפשת תמונות סטילס

    יצירת קטעי וידאו קצרים מתמונות קיימות בלחיצת כפתור אחת.

  • בדיקת פרמטרי תנועה

    כוונון ערכי motion bucket כדי לראות איך רמת התנועה משתנה.

  • ניסוי צעדי דגימה

    בדיקת ההבדל באיכות הווידאו בין 1 ל־50 צעדי עיבוד שונים.

איפה זה נופל

ההדגמה לא תומכת בהזנת הנחיות טקסט, אלא אך ורק בהעלאת תמונה. הדוגמאות המובנות בממשק אינן שמורות מראש בזיכרון מטמון, כך שגם בחירה בהן דורשת רינדור מלא שלוקח זמן זהה לתמונה חדשה. אם תבחרו מספר צעדים נמוך כדי לקצר את ההמתנה, איכות התנועה והפרטים בסרטון תיפגע באופן מורגש, ובחומרה שיתופית כזאת ריצות ארוכות מדי עלולות להיעצר בגלל מגבלות זמן ריצה.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום כלשהו?

הגישה דרך הדפדפן פתוחה ואינה דורשת תשלום או הזנת פרטי אשראי. כל עוד המרחב פעיל ברשת, אפשר להעלות תמונות ולהפיק סרטונים. המגבלה היחידה עשויה להיות זמינות משאבי החומרה השיתופיים של השרת.

כמה זמן לוקח לייצר סרטון שלם?

משך הזמן תלוי ישירות במספר צעדי ההסקה שהגדרתם, שנע בין 1 ל־50. בחומרה מסוג zero-a10g ועם ערך ברירת המחדל של 25 צעדים, העיבוד אורך בדרך כלל בין חצי דקה למספר דקות. בזמני עומס ייתכן שתמתינו בתור עוד לפני תחילת הריצה.

האם אפשר להריץ את אותו הדבר באופן מקומי במחשב?

הקוד משתמש בספריות קוד פתוח מוכרות כמו diffsynth ו־transformers ומופץ ברישיון apache-2.0. אפשר להוריד את הקוד ולהריץ אותו במחשב שלכם, אך תצטרכו כרטיס מסך מתאים עם זיכרון מספק כדי לטעון את שני המודלים.

במה הדגמת הווב הזו שונה מהרצת המודל ישירות בקוד?

הממשק הגרפי חושף רק חלק קטן מההגדרות, כמו מספר צעדים, seed ורמת תנועה. בהרצה ישירה בקוד תוכלו לגשת להגדרות פנימיות נוספות של הצינור ולשלב אוטומציות לקבצים מרובים. כאן התהליך מוגבל לעבודה ידנית על תמונה בודדת בכל פעם.

איך משתמשים

טוענים תמונה לחלון השמאלי ולוחצים על כפתור Generate כדי להתחיל את התהליך. השרת מקצה כרטיס מסך מסוג zero-a10g לפי דרישה בעזרת מודול spaces, כך שאם יש עומס של משתמשים ברשת תצטרכו להמתין בתור לפני שהעיבוד מתחיל בפועל. ברירת המחדל של צעדי הריצה היא 25 שלבים, ובהתאם לפרמטרים שבחרתם העיבוד ייקח בדרך כלל בין כמה עשרות שניות לכמה דקות עד שהווידאו הסופי מופיע בצד ימין.

הרישיון

הקוד וההדגמה מפורסמים תחת רישיון apache-2.0, שמתיר שימוש חופשי ושינוי של הקוד. המידע הקיים לא מפרט תנאים לגבי שמירת התמונות המועלות או הזכויות המסחריות על קובצי הווידאו שנוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗