GPT
S

SCAIL-2_GGUF

קוד פתוח

realrebelaimit2026-06-13

  • gguf
  • quantization
  • comfyui
  • image-to-video
  • character-animation

גרסאות מכווצות של מודל הנפשת דמויות והעברת תנועה מווידאו לתמונה, מבוסס Wan 2.1 14B. הוא מיועד למי שרוצה להריץ את הכלי המקורי בתוך ComfyUI בלי לחנוק את הזיכרון של הכרטיס.

  • 64.0 GBמשקל הקבצים
  • 18,743הורדות בחודש
  • 69לייקים

מה זה

המאגר מכיל שש רמות כימות שונות למודל SCAIL-2, שבמקור פותח על ידי zai-org. המודל מתמקד ביצירת וידאו מתמונה על ידי העברת תנועה מסרטון מקור או הנפשת דמות ספציפית, כשהוא יושב על בסיס הדיפוזיה של Wan 2.1 בגודל 14 מיליארד פרמטרים.

במקום להחזיק משקלי fp16 או fp8 שדורשים כרטיסי מסך יקרים של שרתים, הקבצים כאן נבנו בפורמט GGUF בעזרת הכלים של city96. המשמעות היא שרכיב הדיפוזיה המרכזי ממופה ישירות מהכונן, מה שמאפשר לעבוד בתוך ComfyUI עם צריכת VRAM נמוכה בהרבה בהשוואה למודל השלם.

מתאים ל

  • הנפשת דמות מתמונה בודדת

    מאפשר לייצר תנועה עבור דמות קיימת בתוך ComfyUI עם חומרת צרכנים בזכות הכימות.

  • העתקת תנועה מווידאו

    העברת תנועות גוף והבעות מסרטון מקור אל תמונת סטילס תוך שימוש במודל Wan 2.1.

  • בדיקות תהליכי עבודה מקומיים

    הרצה מקומית של מודל 14B לבדיקת רעיונות בלי לשלם על שעות ענן של מכונות עם 48GB VRAM.

איפה זה נופל

ההתקנה מסורבלת מאוד ודורשת איסוף ידני של חמישה מודלים נלווים ממקורות שונים כדי לבנות תהליך עבודה בסיסי. בנוסף, חובה לספק מסכה צבעונית כקלט גם כשמנפישים דמות בודדת, והצומת הרלוונטי עשוי לדרוש גרסת nightly של ComfyUI. הרזולוציה דורשת הגדרה ידנית עם מידות שמתחלקות ב־16, כמו 832 על 480, ויש אזהרת מערכת מובנית לגבי משקלי ההטמעה שרצה בזמן העבודה. גרסאות הכימות הנמוכות כמו Q2_K מאבדות עקביות ואיכות תמונה.

שאלות
נפוצות

האם קובץ ה־GGUF מכיל את כל מה שצריך כדי להתחיל ליצור סרטונים?

לא. הקובץ מכיל רק את ליבת ה־DiT של המודל. כדי שהמערכת תעבוד יש להוריד עצמאית מקודד טקסט, מקודד ראייה, מודל סגמנטציה של SAM, VAE וקובץ LoRA ייעודי, ולשים כל אחד בתיקייה שלו.

איזו גרסת כימות הכי כדאי להוריד למחשב ביתי?

גרסת Q4_K_M ששוקלת כ־10 גיגה-בייט מוגדרת כבחירה המאוזנת ביותר לעבודה יומיומית. אם יש כרטיס מסך מוגבל במיוחד אפשר לרדת ל־Q3_K_M או Q2_K, אך שם ניכרת פגיעה באיכות התוצאה.

מה משמעות האזהרה על משקלים שלא מוזגו בטעינת המודל?

זו התנהגות צפויה שאינה מעידה על שגיאה. התוכנה בונה בזמן ריצה שכבת הטמעה של 36 ערוצים ומחברת לתוכה את ערוצי המסכה, כך שהקובץ המקורי שמכיל 20 ערוצים נטען בצורה תקינה.

איך מריצים

את קובץ ה־GGUF שמים בתיקיית unet של ComfyUI וטוענים דרך התוסף ComfyUI-GGUF עם הצומת המתאים. הבחירה המומלצת לשימוש יומיומי היא Q4_K_M ששוקל כ־10 גיגה-בייט, בעוד ש־Q2_K יורד ל־6 גיגה-בייט במחיר של פגיעה באיכות, ו־Q8_0 מגיע לכ־17 גיגה-בייט למי שצריך דיוק קרוב למקור.

המודל הזה לא עובד לבד. כדי להפיק סרטון חייבים להוריד בנפרד עוד שורה של קבצים, כולל מקודד טקסט umt5-xxl ב־fp8, מודל SAM 3.1 multiplex, מקודד CLIP Vision, מודל VAE של Wan 2.1, ו־LoRA ייעודי לזיקוק צעדים. בלי כל החלקים האלה בתיקיות שלהם, השרשרת פשוט לא תרוץ.

ollama run hf.co/realrebelai/SCAIL-2_GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח כאן הוא MIT. זה רישיון פתוח ומתירני מאוד שמאפשר להשתמש בקוד ובקבצים לצרכים מסחריים, לשנות אותם ולשלב אותם במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗