GPT
A

AnimeGen-I2V

קוד פתוח

aidealabapache-2.02026-06-17

  • diffusers
  • safetensors
  • text-to-video
  • anime
  • video-generation

הכלי מייצר סרטוני אנימציה קצרים מתוך תמונה קיימת בסגנון אנימה יפני. הוא מתאים למי שרוצה להנפיש איורי דמויות וסטוריבורד בלי להתעסק עם מודלים כלליים.

  • 14Bפרמטרים
  • 107 GBמשקל הקבצים
  • 3,804הורדות בחודש
  • 40לייקים

מה זה

מדובר במודל image-to-video בגודל 14 מיליארד פרמטרים שמבוסס על Wan 2.2 ועבר אימון ייעודי על סגנון אנימה יפני בתמיכת ממשלת יפן. המטרה שלו היא לשפר תנועה של דמויות מצוירות, קומפוזיציית צבעים ועקביות ויזואלית בהשוואה למודלים גנריים שלא מבינים סגנון אנימציה שטוח או קווי מתאר.

בפועל הוא נשען על ארכיטקטורת Diffusion Transformer ומשתלב ישירות בסביבת diffusers של פייתון או בתוך ComfyUI באמצעות קובצי משקולות ייעודיים. הוא תומך גם באינטרפולציה בין פריימים, מה שמאפשר לייצר מעברים חלקים בין שתי תמונות מפתח שונות של אותה דמות.

מתאים ל

  • הנפשת סטוריבורד להפקה

    בדיקת תנועה וקומפוזיציה מהירה מתוך איורים סטטיים של סצנות אנימה לפני שלב האנימציה המלאה.

  • יצירת קטעי וידאו לרשתות

    הפיכת איורי דמויות קיימים לסרטונים קצרים בלולאה שמתאימים לפורמטים חברתיים ברשת.

  • אינטרפולציה בין פריימים

    יצירת מעברי תנועה מונפשים בין שני ציורים קיימים לצורך השלמת שלבי ביניים בהפקה.

איפה זה נופל

המודל מיועד אך ורק לסגנון אנימה ולא יפיק תוצאות סבירות אם תנסו לייצר וידאו ריאליסטי. היוצרים מציינים במפורש בעיות של ריצוד בזמן, עיוותים באצבעות, ידיים, עיניים ואביזרים קטנים, ואיבוד של זהות הדמות לאורך הפריימים. הוא מתקשה מאוד בסצנות אקשן מורכבות או באינטראקציות פיזיקליות עמוסות, כך שאי אפשר להסתמך עליו לרצפים ארוכים ללא בדיקה ידנית של כל פריים.

שאלות
נפוצות

האם אפשר להשתמש בפרומפטים בעברית?

המודל מאומן בעיקר על אנגלית ודף המודל ממליץ במפורש להזין הנחיות באנגלית. עברית ככל הנראה תוביל לתוצאות לא צפויות או להתעלמות מחלק מההוראות, ולכן עדיף לתרגם את הפרומפט מראש.

האם הוא מתאים ליצירת סרטוני וידאו של אנשים אמיתיים?

לא. המודל עבר אופטימיזציה לסגנון אנימה יפני בלבד ואינו מיועד לווידאו פוטו-ריאליסטי. ניסיון להזין לו תמונות של אנשים אמיתיים יפיק תוצאות מעוותות או בעלות מראה מצויר שאינו תואם את המקור.

איך משלבים אותו בתהליכי עבודה קיימים של ComfyUI?

היוצרים שחררו קובצי safetensors ייעודיים עבור ComfyUI של high noise ו־low noise. מורידים את המשקולות הרלוונטיות ומחברים אותן לצינור העבודה הרגיל של Wan 2.2 ללא צורך בכתיבת קוד פייתון.

איך מריצים

בשביל להריץ אותו מקומית צריך לפחות כרטיס RTX 4090 עם 24 גיגה זיכרון גרפי, ועדיף כרטיס עם יותר VRAM אם רוצים רזולוציות גבוהות או סרטונים באורך מלא. המשקל הכולל של הקבצים מגיע ל־107 גיגה, כך שצריך גם נפח אחסון מהיר ונכונות להתמודד עם זמני פריסה לא קצרים.

ההרצה מתבצעת בפורמט bfloat16 דרך diffusers, וכוללת אפשרויות לטעינה בשכבות ו־CPU offload כדי לא לקרוס מחוסר זיכרון. אם אין לכם תחנת עבודה ייעודית או שרת ענן עם חומרה ברמה הזו, הרצה עצמית תהיה איטית ויקרה מדי עבור בדיקות ראשוניות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("aidealab/AnimeGen-I2V")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והטקסט של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗