GPT
M

MiniMax-H3-GGUF

קוד פתוח

Abirayother2026-08-03

  • gguf
  • comfyui
  • text-to-video
  • image-to-video
  • image-text-to-video

גרסאות מכווצות בפורמט GGUF למודל וידאו שמייצר סרטונים באורך של עד 15 שניות עם סאונד סטריאו מובנה. מתאים למי שרוצה שליטה מקומית בהנפשה מתמונה, טקסט או קטעי רפרנס מרובים.

  • 476 GBמשקל הקבצים
  • 974,850הורדות בחודש
  • 131לייקים

מה זה

המאגר הזה מכיל קבצים מכווצים של מודל המייצר וידאו ברזולוציה שמגיעה עד 2K ובקצב של 24 פריימים לשנייה, יחד עם אודיו סטריאו בתדר 32 קילוהרץ. יש כאן שתי גרסאות בסיס עיקריות. הראשונה מיועדת ליצירה מטקסט או לפי תמונת התחלה ותמונת סיום. השנייה עובדת במצב רפרנס רחב, שקולט עד תשע תמונות, שלושה קטעי וידאו ושלושה קטעי אודיו כהנחיה ליצירה.

בניגוד לרוב מודלי הווידאו שמייצרים תמונה אילמת ודורשים מודל נפרד לפסקול, המערכת הזו מוציאה וידאו ואודיו יחד. המודל תומך ביחסי תצוגה שונים כמו 16:9, 9:16 וריבוע, ברירת המחדל עומדת על צד קצר של 768 פיקסלים, ויש תמיכה מובנית בדיבור ב־11 שפות שונות, ביניהן אנגלית, ערבית, צרפתית וספרדית.

מתאים ל

  • מעבר בין תמונת פתיחה לסיום

    גרסת FL2VA מקבלת תמונת התחלה ותמונת סוף ומייצרת ביניהן וידאו של עד 15 שניות.

  • הנפשה מבוססת מספר רפרנסים

    גרסת Ref2VA קולטת עד תשע תמונות או שלושה סרטונים ומפיקה תוכן חדש ששומר על הקשר.

  • יצירת קטעים קצרים עם סאונד

    הפקה ישירה של וידאו יחד עם פס קול סטריאו תואם ב־32 קילוהרץ בלי להצמיד מודל אודיו נפרד.

איפה זה נופל

המודל מוגבל לאורכים שבין 4 ל־15 שניות בלבד, כך שלא ניתן לייצר סצנות ארוכות ברצף ישיר. במצב רפרנס מרובה אי אפשר להזין קול כקלט יחיד, אלא חייבים לצרף לו תמונה או וידאו, וסך כל קבצי הקלט מוגבל ל־12. בנוסף, עברית אינה ברשימת 11 השפות שנתמכות באופן יציב לדיאלוגים, ולכן תרחישים מקומיים שדורשים דיבור מדויק ידרשו בדיקה קפדנית מראש.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי בודד?

זה מורכב מאוד בגרסאות שכאן. הרצת המודל מחייבת טעינה של מודל הווידאו עצמו, מקודד טקסט ששוקל לפחות 14.6 ג'יגה בייט, וקבצי VAE. עבור כרטיסי מסך ביתיים עם נפח זיכרון מוגבל עדיף לבדוק את גרסת הפרונד שמגיעה במשקלים נמוכים בהרבה.

איזו גרסה של המודל צריך להוריד מתוך המאגר?

הבחירה תלויה במשימה שלכם. אם אתם רוצים ליצור וידאו מטקסט או לחבר בין שתי תמונות קבועות, הורידו את FL2VA. אם אתם רוצים להזין סדרה של תמונות, קול ווידאו קיימים כהנחיה כללית, הורידו את Ref2VA, יחד עם מקודד הטקסט וקבצי ה־VAE.

האם המודל מייצר דיבור בעברית בצורה אמינה?

כרטיס המודל מציין רשימה של 11 שפות שנתמכות ביציבות עבור דיאלוגים, ועברית אינה מופיעה בהן. מצוין ששפות נוספות נתמכות ברמות משתנות, ולכן סביר להניח שאיכות הדיבור בעברית תהיה פחות עקבית.

איך מריצים

כדי להריץ אותו צריך להוריד שלושה רכיבים נפרדים: קובץ מודל הווידאו עצמו, מקודד טקסט של 32 מיליארד פרמטרים, ושני קבצי VAE לטיפול בווידאו ובסאונד. הקבצים הגדולים של מודל הווידאו נעים בין 15.6 ג'יגה בייט בכימוס של 3 ביט ועד 36 ג'יגה בייט בגרסת 8 ביט, בנוסף למקודד הטקסט ששוקל בין 14.6 ל־27.1 ג'יגה בייט ול־VAE ששוקל מעל 5 ג'יגה בייט.

מחשב ביתי סטנדרטי לא יסחוב את המבנה הזה בקלות, שכן נדרש זיכרון וידאו מאסיבי רק כדי לטעון את כל החלקים במקביל. מי שמוגבל בחומרה יכול לפנות למאגר הדחוס יותר שמציע קבצים קטנים יותר, או לשקול פתרון ענן חיצוני אם המטרה היא בדיקות נקודתיות בלי לתחזק שרת ייעודי.

ollama run hf.co/Abiray/MiniMax-H3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון קהילתי ייעודי בשם MiniMax H3 Community License Agreement. מדובר ברישיון מותאם אישית ולא ברישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT, ולכן לפני שילוב שלו במוצר מסחרי חובה לקרוא את תנאי ההסכם המלאים כדי להבין אילו מגבלות שימוש מסחרי או הפצה חלות עליכם.

הרישיון המלא בעמוד המודל ↗