GPT
M

MiniMax-H3-Turbo-Lora-Pruned-ComfyUI

קוד פתוח

Abirayother2026-08-06

  • diffusers
  • text-to-video
  • image-to-video
  • image-text-to-video
  • video-to-video

התאמת LoRA מקוצצת שמאיצה יצירת וידאו וסאונד סטריאו ב־ComfyUI. שילוב של סאונד מובנה וקיצוץ צעדים הופך אותה לפתרון מעשי למי שמחפש רינדור מהיר בלי סקריפטים חיצוניים.

  • 2.3 GBמשקל הקבצים
  • 18,192הורדות בחודש
  • 49לייקים

מה זה

מדובר בגרסה מקוצצת של מתאם LoRA שנועדה למודל הווידאו MiniMax-H3, ומותאמת לעבודה ישירה בתוך ComfyUI בעזרת צומת טעינה רגיל. הגרסה המקורית דרשה הרצה של סקריפטים נפרדים בפייתון בגלל מנגנון התזמון הכפול שמייצר וידאו ואודיו במקביל, מה שהקשה על שילוב בסביבות עבודה קיימות. כאן הקבצים עברו סידור וקיצוץ מבני כדי להתאים לזרימת עבודה תקנית.

המתאם מאפשר לחתוך בצורה חדה את מספר צעדי הדגימה הנדרשים ליצירת וידאו, ומוריד את הרינדור לטווח של שמונה עד שנים עשר צעדים בלבד. תוך כדי החיתוך בזמני החישוב, הוא שומר על יצירה מסונכרנת של אודיו סטריאו באיכות של שלושים ושניים קילוהרץ לצד התמונה. כדי להאיץ את התהליך עוד יותר, הקובץ נבדק ונמצא תואם למאיצי קשב שונים כמו SageAttention או Sol Attention, מה שחוסך זמן נוסף בריצות ארוכות.

בניגוד לפתרונות דומים שמתרכזים רק בתמונה ומשאירים את פס הקול לכלים אחרים, המיקוד פה הוא ביצירה המשולבת. ההתאמה בוצעה במיוחד מול צ'קפוינטים מקוצצים של מודל הבסיס שמותאמים ל־ComfyUI, כך שהחיסכון מורגש גם בזיכרון וגם במהירות התגובה הכוללת של המערכת.

מתאים ל

  • הפקת קטעי וידאו עם סאונד

    יצירה ישירה של וידאו עם אודיו מסונכרן בשמונה צעדים בלבד, שמתאימה למי שרוצה לדלג על הוספת סאונד בנפרד.

  • שילוב בשרשראות ComfyUI

    טעינה פשוטה דרך צומת LoRA רגיל בלי צורך להריץ קוד פייתון מותאם אישית מחוץ לתוכנה.

  • בדיקות ופיתוח פרומפטים

    קיצוץ צעדי הדגימה מאפשר להריץ ניסויים ויזואליים מהירים על מודל MiniMax-H3 בלי לחכות לזמני רינדור ארוכים.

איפה זה נופל

המודל רגיש מאוד לתצורה, ואם לא מקפידים על הערכים המדויקים של הסטת הסיגמא, האודיו נהרס לחלוטין והופך לרעש סטטי ומעוות. היצירה הכפולה של וידאו וקול במקביל פירושה שכל סטייה קטנה בבחירת הדוגם או במספר הצעדים דופקת את הסאונד. בנוסף, מדובר רק במתאם שמחייב מודל בסיס מקוצץ של MiniMax-H3 ולא יכול לרוץ לבד, כך שאין כאן חיסכון בדרישות החומרה הגבוהות של המודל המקורי.

שאלות
נפוצות

למה האודיו שיוצא מהמודל נשמע כמו רעש סטטי צורם?

הבעיה נובעת כמעט תמיד מחוסר התאמה בהגדרות התזמון של הסאונד מול הווידאו. צריך לוודא שערך Audio Sigma Shift עומד בדיוק על שש, Video Sigma Shift מוגדר לשתים עשרה, ושאתם משתמשים בדוגם res_multistep.

האם אפשר להשתמש בקובץ הזה מחוץ ל־ComfyUI?

הגרסה הזו עברה ארגון וקיצוץ מיוחדים כדי לפתור בעיות תאימות עם צמתי העבודה של ComfyUI. לשימוש בסקריפטים נפרדים או בספריות אחרות, עדיף להשתמש במאגר המקורי של larryvrh שממנו נוצר הקובץ הזה.

איך מריצים

ההתקנה מסתכמת בהורדת קובץ ה־safetensors והנחה שלו בתיקיית ה־loras הרגילה של ComfyUI, לצד ייבוא קובץ ה־JSON של סביבת העבודה שמצורף במאגר. כדי שהרינדור יצליח חובה להשתמש בדוגם res_multistep ולהגדיר ערכי Video Sigma Shift של שתים עשרה ו־Audio Sigma Shift של שש, בעוצמת מתאם שנעה בין אפס נקודה שמונה לאחת נקודה שמונה.

משקל הקבצים עומד על 2.3 גיגה בייט בתשעה קבצים, שזה קל יחסית למתאמים, אבל מודל הבסיס עצמו דורש כרטיס מסך חזק מאוד כדי לעבד וידאו ואודיו יחד. אם אין לכם חומרת שרת ייעודית עם כרטיס מסך מקומי כבד שמחזיק את המודל הגדול, יהיה זול ופשוט יותר להשתמש ב־API מנוהל במקום להרים סביבה מקומית כבדה מאפס.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Abiray/MiniMax-H3-Turbo-Lora-Pruned-ComfyUI")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־other, מה שאומר שאין כאן רישיון קוד פתוח סטנדרטי ומוכר. המאגר נשען על אימון מקורי של מפתח אחר, ולכן לפני שמכניסים את הקבצים לפיתוח מסחרי או מפיצים מוצר מבוסס עליהם, חובה לבדוק היטב את תנאי השימוש של מודל הבסיס ושל היוצר המקורי כדי להימנע מהפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗