GPT
S

stable-video-diffusion

רץ בדפדפן

mediasynthesismuseumother2023-11-21

  • gradio
  • mcp-server

מעלים תמונה בודדת ומקבלים סרטון קצר שמנפיש אותה. מתאים למי שרוצה לבדוק מהר איך תמונת סטילס זזה בלי להתעסק עם שורת פקודה.

  • הורדות בחודש
  • 2,032לייקים

מה זה

אתם גוררים תמונה לממשק, ולוחצים על כפתור הייצור. מתחת למכסה המנוע רץ המודל Stable Video Diffusion Img2Vid XT של Stability AI באמצעות ספריית diffusers, והוא מייצר סרטון שמבוסס ישירות על התמונה שלכם.

יש בהגדרות המתקדמות סליידר שנקרא motion bucket id בטווח שבין 1 ל־255, שקובע כמה תנועה תהיה בקטע, לצד בחירת סיד וקצב פריימים בין 5 ל־30 בשנייה. אורך הסרטון הסופי נקבע ישירות לפי החישוב של 25 חלקי ה־fps שהגדרתם, כך שקצב פריימים גבוה ייתן קטע קצר יותר. הממשק כולל גם דוגמאות מוכנות מראש לטעינה עצלה, למי שרוצה לראות תוצאה בלי להעלות קובץ משלו.

מתאים ל

  • הנפשת תמונות סטילס

    יצירת קטע וידאו קצר מאיור או צילום קיים כדי לראות אותו בתנועה.

  • בדיקת ערכי תנועה

    משחק עם סליידר התנועה בין 1 ל־255 כדי לבדוק איך המודל מגיב לעוצמות שונות.

  • הדגמה מהירה של המודל

    הערכת היכולות של משפחת דגמי SVD של Stability AI ישירות מהדפדפן.

איפה זה נופל

הכלי מייצר רק קטעים קצרים מאוד של עשרים וחמישה פריימים ולא סרטים שלמים, ואין פה אפשרות להוסיף טקסט או סאונד. בנוסף, המודל מתקשה לשמור על עקביות מלאה בפרטים מורכבים או בתנועות חדות, והתוצאה עלולה להתעוות אם בוחרים ערכי תנועה גבוהים מדי בסליידר.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

האפליקציה פועלת ישירות ברשת וזמינה לשימוש ללא תשלום. היא מנצלת חומרת zero-a10g שמוקצית לפי דרישה. אם יש עומס משתמשים, ייתכן שתצטרכו להמתין עד שיתפנה מעבד גרפי.

מה קורה עם התמונות שאני מעלה לכאן?

התמונות נשלחות לשרת שמריץ את קוד הפייתון כדי לייצר את קובץ הווידאו. הקוד מייצר מזהה ייחודי זמני ושומר את הווידאו המיוצא כדי להציג אותו. לא הייתי מעלה לכאן תמונות רגישות או פרטיות שאינכם רוצים שייחשפו ברשת.

כמה זמן לוקח לייצר סרטון?

זמן ההמתנה מורכב משלב הקצאת החומרה ומשלב העיבוד עצמו. החומרה היא מסוג zero-a10g, כך שברגע שהכרטיס מוקצה, הרינדור של עשרים וחמישה פריימים אורך שניות בודדות עד דקה קלה. הממשק מציג מד התקדמות בזמן אמת.

האם אפשר להריץ את זה באופן מקומי במחשב שלי?

כן, הקוד מבוסס על ספריות diffusers ו־gradio סטנדרטיות וטוען את המודל ישירות מ־Hugging Face. כדי להריץ אותו אצלכם תצטרכו מחשב עם מעבד גרפי חזק של Nvidia וסביבת פייתון מוגדרת. בלי כרטיס מסך מתאים, ההרצה המקומית תהיה איטית מאוד עד בלתי אפשרית.

במה הדמו הזה שונה מהרצת המודל המקורי?

זהו ממשק גרפי מוגבל שנועד לבדיקה מהירה, ולא חבילת פיתוח מלאה. הוא חושף רק חלק מהפרמטרים כמו סיד, קצב פריימים וסליידר תנועה, ומייצר סרטון מקובע של עשרים וחמישה פריימים. אין לכם כאן שליטה עמוקה יותר על ארכיטקטורת הדגימה או על שרשור של פעולות נוספות.

איך משתמשים

טוענים תמונה, פותחים אם רוצים את האפשרויות המתקדמות כדי לקבוע את מידת התנועה או ה־FPS, ולוחצים על Generate. ההרצה משתמשת ברכיב spaces על גבי חומרת zero-a10g, מה שאומר שהעיבוד עצמו יחסית מהיר כשיש כרטיס גרפי פנוי, אבל ייתכן שתמתינו בתור קצר להקצאת החומרה.

הרישיון

הרישיון מוגדר בתור other. המשמעות היא שאין פה רישיון קוד פתוח סטנדרטי וחופשי, ולכן יש לבדוק את תנאי השימוש המקוריים של המודל של Stability AI לפני שמשתמשים בו או בתוצרים למטרות מסחריות.

הרישיון המלא ב־Hugging Face ↗