GPT
A

AnimateLCM

קוד פתוח

wangfuyunרישיון לא דווח2024-02-03

  • diffusers
  • safetensors
  • text-to-video

מייצר וידאו מטקסט בארבעה צעדים בלבד, בלי לחכות דקות ארוכות לכל רינדור. הוא מתאים למי שרוצה לבדוק רעיונות במהירות במקום לשרוף זמן יקר על מודלים כבדים ואיטיים.

  • 454Mפרמטרים
  • 4.3 GBמשקל הקבצים
  • 10,870הורדות בחודש
  • 350לייקים

מה זה

המודל הזה לוקח את הרעיון של Latent Consistency Models ומיישם אותו על יצירת וידאו מטקסט. במקום לבצע עשרות צעדי דה-נויזינג כמקובל במודלים קודמים, הוא מפיק תוצאה סבירה לגמרי בתוך ארבעה צעדים. הדגש פה הוא על מהירות ויעילות חישובית, תוך התמקדות ביצירת סגנון מותאם בלי להזדקק למאגרי וידאו ענקיים לאימון אישי.

עם 454 מיליון פרמטרים, מדובר במודל קומפקטי שמיועד לפעול יחד עם ספריית diffusers. המפרסמים פיתחו גם גרסאות נפרדות שמטפלות במעבר מתמונה לווידאו, אבל המשקלים שכאן ממוקדים בטקסט. המטרה שלו היא לא לנצח מודלים כבדים בפירוט פוטו-ריאליסטי, אלא לתת מענה פרקטי למי שצריך תנועה מהירה בסגנון מוגדר ובעלות חומרה נמוכה בהרבה ממה שהורגלנו ברשתות וידאו גנרטיביות.

מתאים ל

  • בדיקת רעיונות מהירה

    מייצר סקיצות וידאו מטקסט בארבעה צעדים, מה שמאפשר לבחון כיוונים ויזואליים בלי להמתין.

  • הנפשת אנימציה וסגנון

    מיועד להפקת קטעי וידאו בעלי סגנון מוגדר ביעילות חישובית גבוהה יחסית.

  • מחקר על דחיסת מודלים

    מתאים למי שחוקר יישומי LCM ורוצה לראות איך מודל קטן מתמודד עם יצירת תנועה.

איפה זה נופל

הקיצור לארבעה צעדים גובה מחיר באיכות התנועה והפרטים הקטנים. וידאו שנוצר במעט צעדים עלול לסבול מעיוותים גיאומטריים, חוסר יציבות בין פריימים או ארטיפקטים בתנועות מורכבות. בנוסף, הוא מוגבל ליצירה מטקסט, ואם תרצו להנפיש תמונה קיימת תצטרכו לעבור לגרסאות האחרות של הפרויקט. כדאי לבדוק היטב אם הסגנון הוויזואלי שלו עונה על הדרישות שלכם לפני שמתכננים עליו.

שאלות
נפוצות

האם המודל תומך ביצירת וידאו מתוך תמונה קיימת?

המשקלים הספציפיים האלה מיועדים ליצירה מטקסט בלבד. המפתחים יצרו גרסאות נפרדות עבור תמונה לווידאו, כך שתצטרכו להוריד אותן אם זו המטרה.

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא מומלץ כרגע. בעמוד הרשמי לא צוין רישיון כלל, מה שאומר שאין לכם הגנה משפטית או הרשאה ברורה להשתמש בו לצרכים מסחריים.

איך מריצים

הקבצים שוקלים 4.3 גיגה-בייט, ואתם מריצים אותם ישירות דרך ספריית diffusers של פייתון. המודל יושב בלי בעיה על כרטיס מסך בודד עם זיכרון צנוע, כי הוא דורש מעט מאוד חישובים עבור ארבעת הצעדים שלו בלבד.

אם אין לכם כרטיס גרפי ייעודי או שאתם לא רוצים להגדיר סביבת עבודה מקומית, פנייה ל־API מרוחק תחסוך את כאב הראש. עם זאת, בזכות גודל הקבצים והריצה הקצרה, זו אחת החבילות שהכי קל לבדוק ישירות על מכונה מקומית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("wangfuyun/AnimateLCM")
img = pipe("a photo").images[0]

הרישיון

היוצר לא דיווח על רישיון בעמוד המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שילוב שלו במוצר מסחרי חושף אתכם לתביעות זכויות יוצרים. מומלץ לבדוק את הרישיון שמופיע בקוד המקור בגיטהאב לפני שמעלים אותו לשרת ייצור.

הרישיון המלא בעמוד המודל ↗