GPT
H

Hotshot-XL

קוד פתוח

hotshotcoopenrail++2023-10-03

  • diffusers
  • safetensors
  • text-to-video
  • stable-diffusion

הופך טקסט לקובצי גיף קצרים של שנייה אחת ומבוסס על אקוסיסטם הכלים של סטייבל דיפיוז'ן. הפתרון מתאים למי שרוצה לייצר אנימציות עם מודלי SDXL קיימים בלי לאמן מודל וידאו מאפס.

  • 2.8Bפרמטרים
  • 15.1 GBמשקל הקבצים
  • 5,182הורדות בחודש
  • 318לייקים

מה זה

במקום להמציא גלגל חדש ליצירת וידאו, המודל הזה מתלבש ישירות על תשתית SDXL. הוא מייצר סרטוני גיף באורך שנייה אחת בדיוק בקצב של 8 פריימים לשנייה, תוך שימוש במקודדי הטקסט של OpenCLIP ו־CLIP. היתרון המרכזי כאן הוא החיבור המיידי לעולם קיים של מודלים מותאמים, מה שחוסך את הצורך לגעת בווידאו בשלב האימון.

בפועל, אתם יכולים לקחת כל צ'קפוינט או משקולות LoRA שכבר אימנתם לתמונות רגילות ב־SDXL, ולחבר אליהם את שכבת התנועה הזו. היוצרים ממליצים להשתמש במודלי בסיס שעברו התאמה לרזולוציה של 512 על 512 כדי לקבל תוצאות טובות, מה שמאפשר לייצר אנימציות מותאמות אישית במהירות בלי להתעסק עם דאטה־סטים מורכבים של וידאו.

מתאים ל

  • הנפשת דמויות מותאמות

    חיבור ישיר למודלי LoRA קיימים של SDXL כדי ליצור גיף קצר של דמות מוגדרת מראש.

  • יצירת סטיקרים מונפשים

    הפקת אנימציות קצרות של שנייה אחת בקצב 8 פריימים לצ'אטים וממשקים גרפיים.

  • שילוב עם ControlNet

    שליטה במבנה התנועה והקומפוזיציה של הגיף בעזרת כלי בקרה תואמים של SDXL.

איפה זה נופל

התוצרים מוגבלים מאוד: שנייה אחת ו־8 פריימים בלבד, בלי תנועה ארוכה. המפתחים מודים בגלוי שהמודל נכשל ברינדור טקסט קריא ומתקשה מאוד ביצירת פנים ואנשים, שעלולים לצאת מעוותים. בנוסף, קומפוזיציות מורכבות של יחסים בין עצמים, כמו קובייה אדומה מעל כדור כחול, מתפרקות בקלות. אם אתם צריכים ריאליזם גבוה או סצנה יציבה עם בני אדם, המודל הזה יאכזב אתכם.

שאלות
נפוצות

האם אפשר להשתמש במודל כדי לייצר סרטונים ארוכים?

לא. המודל אומן באופן קשיח לייצר גיפים באורך של שנייה אחת בדיוק ובקצב של 8 פריימים לשנייה. הוא לא מיועד ליצירת קליפים ארוכים או סרטונים רציפים מעבר למסגרת הזו.

האם חייבים לאמן את המודל מחדש על קובצי וידאו כדי לשנות סגנון?

אין צורך לאמן את המודל עצמו על וידאו. אתם פשוט טוענים מודל SDXL רגיל או LoRA שאומן על תמונות סטילס, ושכבת התנועה יודעת לעבוד איתם ישירות.

האם המודל תומך ברזולוציות גבוהות מחוץ לקופסה?

המודל תומך ביחסי ממדים שונים, אך המפתחים ממליצים במפורש להשתמש במודל בסיס שעבר התאמה ל־512 על 512 פיקסלים כדי לקבל תוצאות יציבות ותקינות.

איך מריצים

המודל שוקל 15.1 גיגה־בייט הפרוסים על פני 23 קבצים ודורש הרצה באמצעות ספריית diffusers. מדובר ב־2.8 מיליארד פרמטרים שמצטרפים למודל הבסיס של SDXL, ולכן נדרש כרטיס מסך חזק עם זיכרון VRAM משמעותי כדי לטעון את שני המודלים במקביל וליצור את שמונת הפריימים בלי לקרוס.

המפתחים מעמידים גם אתר לבדיקה מהירה, כך שאם אתם רק רוצים לראות איך זה עובד או שהתשתית המקומית שלכם מוגבלת, אין סיבה להוריד 15 גיגה למחשב. כדאי להרים סביבה מקומית רק אם אתם בונים שרשרת עבודה שמשלבת LoRA ספציפי או בקרת מבנה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("hotshotco/Hotshot-XL")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא OpenRAIL פלוס פלוס M. הוא מאפשר שימוש מסחרי והפצה, אבל כולל הגבלות שימוש מחייבות בתחומים פוגעניים או מזיקים לפי הנספחים של הרישיון. אם אתם משלבים אותו במוצר מסחרי, אתם מחויבים להעביר את תנאי הרישיון הלאה למשתמשי הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗