GPT
M

unsloth/MiniMax-H3-GGUF

קוד פתוח

unslothother2026-08-07

  • gguf
  • text-to-video
  • image-to-video
  • video-generation
  • stable-diffusion.cpp

המודל מייצר סרטוני וידאו של עד 15 שניות עם פס קול סטריאו מובנה. מפתחים בוחרים בו בעיקר כדי להפיק סאונד ווידאו יחד בריצה מקומית בפורמט GGUF.

  • 198 GBמשקל הקבצים
  • 700,828הורדות בחודש
  • 270לייקים

מה זה

המאגר מכיל גרסאות מכווצות בפורמט GGUF של MiniMax H3, מודל שמפיק וידאו יחד עם שמע סטריאו מובנה בתדר של 32 קילו הרץ ובקצב של 24 פריימים לשנייה. בשונה ממודלים שמייצרים תמונה בלבד ודורשים מודל נפרד להדבקת סאונד, כאן האודיו נוצר ישירות כחלק מתהליך הדיפיוזיה עצמו. התמיכה בשפות מוגדרת לאנגלית ולסינית.

הארכיטקטורה מפוצלת לשני רכיבים עיקריים שצריך להריץ יחד. הראשון הוא מקודד טקסט מסוג Qwen3 VL בגודל 32B, והשני הוא מודל הדה נויזינג עצמו. המאגר כולל שני צ'קפוינטים נפרדים לחלוטין למשימה זו: fl2va שנועד ליצירה מטקסט ומפריים ראשון או אחרון, וגרסת ref2va שנועדה ליצירה על בסיס קובצי רפרנס של תמונה, וידאו או אודיו.

מתאים ל

  • יצירת וידאו עם סאונד מובנה

    המודל מתאים להפקת קליפים של עד 15 שניות כשצריכים שמע סטריאו מסונכרן ישירות מהפרומפט.

  • הנפשת תמונות מקצה לקצה

    גרסת fl2va מתאימה לחיבור תמונת פתיחה או סיום לסרטון מלא באורך 124 פריימים.

  • הפקה על בסיס רפרנס מולטימדיה

    גרסת ref2va יודעת לקבל תמונות, קטעי וידאו ואודיו קיימים כהנחיה לייצור סרטון חדש.

איפה זה נופל

חובה לשים לב למגבלות הריצה הטכניות. שרשור הפקודה קורס מיד אם שוכחים להגדיר את ערך ה cfg על 1.0 בדיוק, או אם לא מגדירים במפורש את מצב הריצה לווידאו. המאגר עצמו אינו שלם ואינו מכיל את קובצי ה VAE הנדרשים לווידאו ולאודיו, כך שלא ניתן לייצר פלט תקין בלי להוריד אותם עצמאית ממקור אחר. בנוסף, חלוקת המודל לשני צ'קפוינטים נפרדים דורשת החלפה והורדה של קבצים שונים לחלוטין אם רוצים לעבור מעבודה עם פריימים לעבודה עם קובצי רפרנס.

שאלות
נפוצות

אפשר להוריד רק קובץ אחד ולהתחיל להריץ וידאו?

לא. המערכת מחייבת לפחות שלושה רכיבים נפרדים: קובץ דה נויזינג אחד, מקודד טקסט של Qwen3 VL, ושני קובצי VAE לווידאו ולאודיו שצריך להוריד ממקור חיצוני.

למה המודל קורס כשאני מריץ אותו עם הגדרות רגילות של סטייבל דיפיוז'ן?

הוא עבר זיקוק ומחייב cfg scale בערך של 1.0 בדיוק. ערך ברירת המחדל הרגיל של 7.0 גורם לו לעצור מיד.

איזו גרסה לבחור בין fl2va לבין ref2va?

זה תלוי בקלט שיש לכם. אם אתם עובדים עם טקסט ורוצים להזין פריים ראשון או אחרון בוחרים ב fl2va, ואם רוצים לבסס את היצירה על קובצי תמונה, וידאו או סאונד קיימים כרפרנס בוחרים ב ref2va.

איך מריצים

הרצת המודל דורשת שילוב של קובץ הדה נויזינג, מקודד הטקסט וקובצי VAE חיצוניים לווידאו ולאודיו שלא כלולים במאגר. משקלי הדה נויזינג נעים בין 6.22 גיגה בייט בגרסאות Q2_K ועד כמעט 20 גיגה בייט בגרסאות Q8_0, בעוד מקודד הטקסט תופס לבדו בין 12.2 ל 16.97 גיגה בייט. כדי להכניס את ההרצה לכרטיס מסך ביתי יחיד, חובה לפרוק את מקודד הטקסט למעבד באמצעות הדגל te=cpu, ובמידת הצורך להשתמש ב offload לזיכרון הראשי.

בעבודה עם כלי שורת הפקודה sd cli חובה להגדיר מצב vid gen וערך guidance של 1.0 בדיוק, כי המודל מזוקק וכל ערך גבוה יותר גורם לקריסה. אם אין לכם כרטיס עם מספיק זיכרון וידאו פנוי או סבלנות לזמני עיבוד ארוכים של וידאו ואודיו יחד, עדיף להשתמש ב API חיצוני במקום לנהל את קובצי הענק האלה מקומית.

ollama run hf.co/unsloth/MiniMax-H3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקבצים מופצים תחת רישיון הקהילה של MiniMax, והם מוגדרים כנגזרת מודל שעברה קוונטיזציה. הרישיון כולל הגדרות טריטוריאליות ומחריג אזורי שיפוט מסוימים, כך שאינו רישיון חופשי פתוח לכל שימוש. לפני שמשלבים אותו במוצר מסחרי, חובה לבדוק את מסמך הרישיון המקורי ורשימת ההחרגות.

הרישיון המלא בעמוד המודל ↗