GPT
M

Minimax-h3-Turbo

קוד פתוח

lightx2vapache-2.02026-08-07

  • diffusers
  • t2v
  • i2v
  • r2v
  • image-to-video

הופך תמונות סטילס לווידאו ברזולוציית 768p בשמונה צעדי דגימה בלבד. מיועד למי שמחפש רינדור מהיר יחסית של וידאו ואודיו יחד מחומרי גלם קיימים.

  • 23.1 GBמשקל הקבצים
  • 1,313,916הורדות בחודש
  • 883לייקים

מה זה

מדובר במודל image to video שמבוסס על משקולות LoRA בפורמט bf16, ושוקל כעשרים ושלושה גיגה בייט שמחולקים לשבעה עשר קבצים. התפקיד שלו הוא לקבל תמונה וליצור ממנה רצף וידאו שכולל גם פס קול, כאשר הדגש של גרסת הטורבו הזו הוא חיתוך זמני הרינדור לשמונה צעדים בלבד.

ההבדל מול מודלים כבדים אחרים הוא התמיכה המובנית בספריית diffusers יחד עם ארכיטקטורת האצה ייעודית. במקום תהליך יצירה ארוך שדורש עשרות שלבים ומייקר את הריצה, הוא מפיק וידאו ברזולוציה מוגדרת מראש של 768p תוך זמן קצר יותר, וכולל כבר בתוכו שכבת הפקת אודיו תואמת לווידאו.

הוא מיועד ספציפית לעבודה בשפות אנגלית וסינית, ומתמקד בתנועה שמתחילה מפריים בודד. מי שרגיל למודלים של טקסט לווידאו ימצא כאן תהליך אחר, כי נקודת המוצא חייבת להיות תמונה קיימת ולא תיאור מילולי בלבד.

מתאים ל

  • הנפשת תמונות סטילס

    הופך תמונות קיימות לקטעי וידאו קצרים ברזולוציית 768p במהירות גבוהה של שמונה צעדים.

  • יצירת וידאו עם סאונד

    מייצר קליפ שכולל וידאו ואודיו מסונכרן מתמונה אחת, בלי צורך במודל סאונד חיצוני נפרד.

  • שילוב בצינורות diffusers

    נטען ישירות לסביבות עבודה סטנדרטיות בפייתון לצורך אוטומציה של תוכן גרפי.

איפה זה נופל

הכרטיס מציג תמיכה בשפות אנגלית וסינית בלבד, כך שאין כאן התאמה להנחיות בעברית. מעבר לזה, המודל מוגבל לרזולוציה של 768p ומחייב תמונת מקור כדי לעבוד, כלומר הוא לא מייצר סרטונים מטקסט חופשי. שמונת צעדי הדגימה שמאיצים את התהליך גובים מחיר פוטנציאלי בדיוק הפיזיקלי של התנועה ובאיכות האודיו ביחס למודלים מרובי צעדים, ודפי התיעוד לא מפרטים מדדים מספריים על עיוותים או אובדן יציבות בפריימים.

שאלות
נפוצות

האם המודל מסוגל לייצר וידאו ישירות מטקסט ללא תמונה?

לא. המשימה המוגדרת של המודל היא תמונה לווידאו, והוא דורש פריים התחלתי כדי לבנות סביבו את התנועה.

האם כדאי להריץ אותו מקומית או לפנות ל־API?

אם יש לכם כרטיס עם מספיק זיכרון להחזיק מעל עשרים ושלושה גיגה בייט, הרצה מקומית תיתן לכם שליטה מלאה. אם אתם צריכים רק בדיקות או תשתית גמישה, ה־API של המפתחים חוסך את ניהול השרתים.

האם אפשר להשתמש במודל למוצר מסחרי בישראל?

כן. הרישיון הוא apache-2.0, שמתיר שימוש מסחרי מלא כולל התקנה על שרתים משלכם, בתנאי ששומרים על תנאי הרישיון והקרדיט המקורי.

איך מריצים

בשביל להוריד ולהחזיק 23.1 גיגה בייט של קבצי משקולות בזיכרון תצטרכו כרטיס גרפי ייעודי חזק עם נפח VRAM משמעותי, במיוחד כשרצים בסביבת diffusers עם דיוק bf16. ההרצה המקומית דורשת משיכת הקבצים מהמאגר וטעינת ה־LoRA הרלוונטי, כמו גרסת שמונת הצעדים.

אם אין לכם שרת עם מאיץ מתאים פנוי, או שאתם לא רוצים להתעסק עם ניהול תלויות וספריות כבדות, המפתחים מציעים API רשמי דרך LightX2V. לטסטים מהירים ולוולידציה ראשונית עדיף להשתמש בנקודת הקצה שלהם לפני שמשקיעים בהקמת תשתית עצמאית יקרה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lightx2v/Minimax-h3-Turbo")
img = pipe("a photo").images[0]

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי בקוד ובמשקולות, כולל שימוש מסחרי, שינוי הקוד והפצה מחדש. המשמעות היא שאתם יכולים לשלב את המודל ישירות בתוך מוצר מסחרי או להריץ אותו בשירות לקוחות בתשלום, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗