GPT
R

Rotate

קוד פתוח

Remade-AIapache-2.02025-03-11

  • diffusers
  • text-to-image
  • lora
  • image-to-video
  • en

תוספת LoRA לתמונת מקור שמייצרת וידאו של סיבוב 360 מעלות סביב האובייקט. הפתרון מיועד למי שרוצה לשלוט ישירות בתנועת המצלמה בתוך תשתית Wan2.1.

  • 348 MBמשקל הקבצים
  • 3,352הורדות בחודש
  • 76לייקים

מה זה

מדובר במשקולות LoRA קלות משקל שמתלבשות על מודל הבסיס Wan2.1 14B בגרסת תמונה לווידאו ברזולוציית 480p. המטרה כאן מאוד ממוקדת: לקחת תמונה של חפץ, כלי רכב או אדם, ולגרום לו להסתובב סיבוב מלא סביב צירו בסרטון קצר. במקום להיאבק בפרומפטים טקסטואליים שלרוב מתעלמים מבקשות של זוויות צילום, המודל אומן להגיב למילת הפעלה ספציפית.

האימון עצמו צנוע למדי, ובוצע במשך 20 מחזורים על גבי 30 שניות של וידאו בסך הכול, שחולקו ל־12 קטעים קצרים ומתויגים. החידוש כאן הוא עצם היכולת לבודד תנועת מצלמה מסוג זה למשקל קטן, בלי להעמיס על מודל הבסיס הגדול שמנהל את הרינדור בפועל.

מתאים ל

  • הצגת מוצרים לחנויות

    הפיכת תמונת סטילס בודדת של מוצר לסרטון סיבוב קצר המדגים נפח, בלי צורך בצילום וידאו באולפן.

  • אפקטים לווידאו ב־ComfyUI

    שילוב תנועת מצלמה של 360 מעלות כשלב מוגדר מראש בתוך צינור ייצור תוכן קיים מבוסס Wan2.1.

  • הנפשת דמויות לרשתות

    יצירת סיבוב סביב דמות או כלי רכב מתמונה אחת, לצורך קטעי מעבר מהירים בסרטונים.

איפה זה נופל

הנתון הבעייתי ביותר הוא נפח האימון. אימון על 30 שניות וידאו ו־12 קליפים בלבד מעיד על בסיס דאטה צר מאוד. המודל עלול להיכשל בשמירה על עקביות של פרטים מאחור, שכן הוא צריך להמציא את החלק הנסתר של האובייקט.

בנוסף, הוא מוגבל לרזולוציה של 480p בלבד ומותאם ספציפית לגרסת ה־14B של Wan2.1. אם תנסו לחבר אותו לגרסאות אחרות או לייצר תוכן חד ומפורט בברירת מחדל, תיתקלו בעיוותים ובמריחות של התמונה המקורית.

שאלות
נפוצות

האם אפשר להריץ את הקובץ הזה לבד בלי מודלים נוספים?

לא. מדובר בתוסף מסוג LoRA ששוקל 348 מגה־בייט וכולל רק את השינויים שנלמדו. חובה לטעון במקביל את מודל הבסיס Wan2.1 14B I2V כדי לייצר את הווידאו.

איך גורמים למודל לבצע את הסיבוב בפועל?

צריך להגדיר את עוצמת ה־LoRA ל־1.0 בתוכנת ההרצה, ולהוסיף לפרומפט את ביטוי ההפעלה r0t4tion 360 degrees rotation יחד עם תיאור האובייקט שבתמונה.

למה הסרטון יוצא ברזולוציה נמוכה?

האימון בוצע ספציפית על גרסת ה־480p של Wan2.1. זו הרזולוציה הטבעית של המשקולות האלו, וכדי לקבל תוצר חד יותר תצטרכו להעביר את הווידאו המוגמר תהליך הגדלה נפרד.

איך מריצים

הקובץ עצמו שוקל 348 מגה־בייט בלבד, אבל הוא לא רץ לבד. כדי להפעיל אותו תצטרכו להעלות קודם את מודל הבסיס Wan2.1 14B I2V, שדורש מעבד גרפי חזק מאוד עם נפח זיכרון משמעותי, בדרך כלל 24 גיגה־בייט ומעלה כדי לעבוד מקומית בצורה סבירה.

המפתחים סיפקו קובץ זרימת עבודה ל־ComfyUI המבוסס על התוסף של Kijai, שם מחברים צומת LoRA ייעודי למודל הבסיס. ההגדרות המומלצות כוללות עוצמת מודל של 1.0, Embedded Guidance Scale בערך של 6.0, ו־Flow Shift ברמה של 5.0, יחד עם צירוף מילת ההפעלה r0t4tion 360 degrees rotation לפרומפט. אם אין לכם חומרה ייעודית, עדיף להריץ את זה דרך שירות ענן או דרך האפליקציה של היוצרים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Remade-AI/Rotate")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקולות, והפצה מחדש בלי תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי. יש לוודא בנפרד שגם תנאי השימוש של מודל הבסיס Wan2.1 מאפשרים את השימוש המסחרי שאתם מתכננים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗