GPT
M

MiniMax-H3-Turbo-Lora-ComfyUI

קוד פתוח

drbaphapache-2.02026-08-06

  • minimax-h3
  • lora
  • adapter
  • comfyui
  • text-to-video

הקבצים האלה חותכים את זמן הרינדור של MiniMax-H3 לארבעה עד שמונה צעדים בלבד, ישירות מתוך ComfyUI.

  • 18.0 GBמשקל הקבצים
  • 218,703הורדות בחודש
  • 405לייקים

מה זה

המאגר הזה מאגד מתאמי LoRA ממוטבים עבור מודל הווידאו והאודיו MiniMax-H3, במטרה לקצר את תהליך הדגימה למינימום. היוצר לקח משקולות קיימות מפרויקטים כמו LightX2V וחישובי זיקוק של משתמשים אחרים, והמיר אותם למבנה תואם ComfyUI תוך דחיסה באמצעות SVD דינמי. הדחיסה הזו הורידה את נפח הקבצים בעשרות אחוזים, למשל מ־1,865 מגה-בייט לכ־312 מגה-בייט בגרסת ה־Ref2V, תוך שמירה על דיוק מתמטי גבוה מאוד בשחזור המשקולות.

בפועל, המספרים האלה מראים שחזור טנזורים של מעל 98% מנורמת פרובניוס, אך הם אינם מעידים ישירות על טיב הווידאו בעין. התוצאה היא האצה של ייצור וידאו ואודיו מסונכרן בשמונה, שישה או ארבעה צעדים, ללא צורך בהמתנה הארוכה שמאפיינת רינדור וידאו מלא במודלי דיפוזיה.

מתאים ל

  • תצוגה מקדימה מהירה

    רינדור של ארבעה צעדים מאפשר לבדוק תנועה וקומפוזיציה בתוך שניות לפני הפקה מלאה.

  • הפקת וידאו מבוסס רפרנס

    גרסת ה־Ref2V המוקטנת מאפשרת להזין תמונת מקור ולקבל תנועה ב־4 צעדים עם קובץ של 312 מגה-בייט.

  • יצירת קטעים עם סאונד מובנה

    הפעלת 8 צעדים עם מתזמן Beta מייצרת וידאו מיוצב יחד עם ערוץ שמע מסונכרן.

איפה זה נופל

המתאמים הישנים עברו חיתוך אגרסיבי של 102 טנזורים מסוג AdaLN שלא התאימו למבנה, ולכן הם לא מתנהגים כמו המודל המקורי המלא. יצירת האודיו המסונכרן רגישה מאוד לכל סטייה בהגדרות, וכוונון לא מדויק של סיגמא או שימוש במתזמן שגוי מייצר רעש לבן או סאונד מעוות לחלוטין. כמו כן, בגרסת ה־v1.1 הדחוסה עם דרגה ממוצעת 28 נרשמה שגיאת L2 יחסית של כמעט 23 אחוזים במשקולות, מה שעלול לפגוע באיכות התנועה בייצור מהיר של ארבעה צעדים.

שאלות
נפוצות

למה האודיו יוצא צורם או מלא רעש לבן?

האודיו והווידאו מחושבים בשני מסלולים נפרדים שדורשים ערכי סיגמא שונים לחלוטין. צריך לוודא שמוגדר ערך של 12 לווידאו ובין 4 ל־6 לאודיו, ושהמתזמן נקבע ל־Beta עם דוגם Euler.

באיזה קובץ מהרשימה כדאי להשתמש להתחלה?

הקובץ המומלץ ביותר לתזרימי עבודה קיימים הוא v4 step-600 בגרסת ה־EMA שלו. אם עובדים בתצורת LightX2V, עדיף לבחור בגרסת 8 הצעדים כדי לקבל יציבות מרבית בתנועה ובקול.

איך מריצים

זורקים את קובצי ה־safetensors הרצויים לתיקיית הדגמים של ComfyUI, טוענים את תזרים העבודה המצורף ומחברים למודל הבסיס. בעבודה עם קובץ ה־EMA המומלץ מגדירים דוגם Euler עם מתזמן Beta בעוצמת מתאם של 1.0, ומכוונים את הסטת הסיגמא ל־12 בווידאו ובין 4 ל־6 באודיו.

המאגר כולו שוקל 18 גיגה-בייט ומכיל גרסאות רבות, אך בזמן ריצה טוענים רק קובץ LoRA יחיד ששוקל בין 284 ל־891 מגה-בייט. הדרישה המשמעותית לחומרה מגיעה ממודל הבסיס של MiniMax-H3 עצמו ולא מהמתאמים, כך שאם אין לכם מאיץ גרפי חזק שמסוגל להחזיק את מודל הווידאו המלא בזיכרון, פנייה ל־API חיצוני תהיה זולה ופשוטה בהרבה.

pip install -U huggingface_hub
hf download drbaph/MiniMax-H3-Turbo-Lora-ComfyUI

הקבצים

33 קבצים במאגר, 18.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי קוד והפצה מחדש. התנאי העיקרי הוא מתן קרדיט ברור למפתחים המקוריים ושמירה על תנאי הרישיון. עם זאת, השימוש בפועל מותנה ברישיון ובמגבלות של מודל הבסיס MiniMax-H3 עצמו, שבלעדיו לקבצים האלה אין ערך תפעולי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗