GPT
M

minimax-h3-reference

רץ בדפדפן

multimodalartרישיון לא דווח2026-08-02

  • gradio

הכלי מייצר וידאו עם פסקול מסונכרן על בסיס הנחיית טקסט ודוגמאות של תמונה, קול או וידאו. הוא מתאים ליוצרים ומפתחים שרוצים לבחון את MiniMax-H3 במשקל מלא ללא קוונטיזציה.

  • הורדות בחודש
  • 86לייקים

מה זה

בממשק מזינים תיאור טקסטואלי ומעלים רפרנסים בלשוניות נפרדות, כולל עד 9 תמונות, קובץ אודיו אחד וסרטון וידאו אחד באורך של 2 עד 15 שניות. התוצאה המתקבלת היא קובץ וידאו בקצב של 24 פריימים לשנייה, עם ציר קצר של 768 פיקסלים ופסקול תואם שנוצר באותו מעבר פענוח. הדוגמאות המוכנות כוללות פורטרט נשי מתמונת סטודיו, דגימת קול של דיבור בקובץ מונו וסרטון קצר לבדיקת תנועה.

מאחורי הקלעים פועל מודל MiniMax-H3 בפורמט bfloat16 מלא, שחולק לשני מרחבים נפרדים עקב מגבלת האחסון של ZeroGPU. המרחב הזה מחזיק את שלבי הדה-נויזינג והמקודדים ברמת משקל של מעל 70 גיגה-בייט, ומתקשר ברשת עם מרחב נפרד שמריץ את Qwen3-VL לעיבוד הטקסט. הבלוקים של הטרנספורמר משתמשים בהידור של חבילת AOTI כדי לחסוך זמן בהפעלת הקרנלים בכל צעד חישוב.

מתאים ל

  • יצירת וידאו מונחה דמות

    מעלים תמונת פנים והנחיית טקסט כדי לייצר סצנה חדשה ששומרת על מאפייני הדמות והסגנון החזותי.

  • הנפשת וידאו עם דיבוב

    משלבים תמונה עם קובץ קול כדי להפיק סרטון מותאם באורכו שבו הסאונד מכתיב את משך התוצאה.

  • העברת תנועה מקליפ קיים

    מזינים סרטון רפרנס קצר כדי להעתיק תנועות מצלמה ודינמיקה חזותית לתוך סצנה שמוגדרת בטקסט.

איפה זה נופל

חובה לצרף תמונה או וידאו בכל הפעלה, ואי אפשר לספק קובץ קול לבדו. בנוסף, חל איסור על הנחיות שליליות עקב מבנה הזיכוך של המודל, ובקשות של 15 שניות נדחות בגלל עיגול מתמטי של מספר הפריימים. שרשור הרפרנסים מגדיל את אורך הרצף בצורה חדה, כך שהוספת וידאו מקפיצה את זמן הריצה מ־2.4 שניות לצעד לכ־16 שניות לצעד, מה שעלול להוביל לכישלון בהקצאת מכסת המשאבים בחשבון עמוס.

שאלות
נפוצות

האם השימוש באפליקציה בחינם?

הגישה לממשק חופשית, אך הריצה תלויה במכסת הקרדיטים של ZeroGPU בחשבון שלכם. מכיוון שכל יצירה משריינת מאות שניות של עיבוד, החשבון עלול להגיע לתקרה ולהיחסם זמנית.

כמה זמן לוקח לייצר סרטון?

התהליך דורש מספר דקות לכל בקשה. המודל מחשב 28 צעדים כברירת מחדל, וכל רפרנס של תמונה או וידאו מאריך את זמן העיבוד באופן משמעותי, מעבר לעשר שניות של טעינה ראשונית לכרטיס המסך.

במה היישום הזה שונה מהרצת המודל המקורי?

המודל המלא דורש כמעט 200 גיגה-בייט ונחתך כאן לשני שרתים נפרדים כדי להתאים למגבלות האחסון. קידוד הטקסט מתבצע ברשת דרך שרת ייעודי של Qwen3-VL, בזמן שפענוח התמונה והקול מתבצע במרחב הנוכחי.

האם אפשר להריץ את האפליקציה מקומית על המחשב?

רק אם יש לכם חומרת שרתים חריגה. משקלי הדה-נויזינג והמקודדים לבדם תופסים מעל 70 גיגה-בייט בזיכרון, בנוסף לרכיב הקידוד הנפרד, כך שכרטיס מסך ביתי רגיל אינו מסוגל להחזיק אותם.

איך משתמשים

בוחרים דוגמה או מעלים קבצים, כותבים הנחיה ולוחצים על Generate. ברירת המחדל עומדת על 28 צעדים, ובהגדרות המתקדמות אפשר לקבוע קנבס, סיד או משך זמן בין 5 ל־14 שניות. האפליקציה רצה על חומרת zero-a10g, שבה המשאבים מוקצים פר בקשה ולא באופן רציף. החישוב שורף זמן GPU יקר, ובקשה ממוצעת עם תמונה בודדת משריינת כ־460 שניות כדי לעבד את הנתונים, כך שזמן ההמתנה בפועל עשוי להגיע למספר דקות.

הרישיון

הרישיון לא דווח בעמוד המאגר. המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי או להפצה מחדש של הפלטים והקוד. חלק מחומרי ההדגמה מגיעים ברישיונות חופשיים כמו Pexels ו־CC BY 4.0, אך התוכן שאתם מעלים עובר דרך שרתי המערכת וקריאות רשת בין שני מרחבים, ומופעל עליו מסנן תוכן מבוסס ncii-guard.

הרישיון המלא ב־Hugging Face ↗