GPT
H

HY-OmniWeaving

קוד פתוח

tencentother2026-03-31

  • HunyuanVideo-1.5
  • diffusers
  • safetensors
  • image-to-video
  • en

מודל ליצירת וידאו שמחבר טקסט, כמה תמונות מקור וקטעי וידאו בעזרת מודל שפה שמנתח את הכוונה לפני הרינדור. הוא שוקל 51.5 גיגה ומיועד למי שצריך הרכבת סצנות מורכבות.

  • 51.5 GBמשקל הקבצים
  • 130הורדות בחודש
  • 273לייקים

מה זה

הארכיטקטורה של טנסנט מבוססת על שלד של HunyuanVideo-1.5 ומחברת שלושה רכיבים: מודל שפה רב מודלי, מודל דיפיוז'ן מסוג MMDiT ודוחס תמונה VAE. מודל השפה משמש כאן בתור מפענח סמנטי שמסוגל לעבוד במצב חשיבה, שבו הוא מייצר שלבי ביניים ומנסח לעצמו פרומפט מורחב ומדויק לפני תחילת יצירת הפריימים.

המערכת לוקחת מצבי ביניים מכמה שכבות של מודל השפה ומזריקה אותם ישירות לשלוש השכבות הראשונות של ענף ההתניה בדיפיוז'ן, בדומה למנגנון דיפ סטאקינג. המבנה הזה מאפשר לו לתמוך ביצירת וידאו מטקסט, הנפשת תמונה בודדת, חיבור בין שני פריימים שונים, עריכת סרטון קיים ושילוב של עד ארבע תמונות רפרנס שונות באותו קליפ.

מתאים ל

  • הנפשה בין שני פריימים

    יצירת סרטון שמגשר בצורה רציפה בין תמונת התחלה לתמונת סיום מוגדרות מראש.

  • שילוב דמויות מכמה מקורות

    הכנסת עד ארבע דמויות או עצמים מתמונות רפרנס נפרדות לתוך סצנה אחת.

  • עריכת סגנון לפי הוראה

    שינוי סגנון או החלפת עצמים בתוך סרטון קיים בעזרת הוראת טקסט ישירה.

איפה זה נופל

כאשר מעלים מספר תמונות רפרנס שונות, כולן נחתכות במרכז כדי להתאים לפרופורציות של התמונה הראשונה, מה שמחייב הכנה מדויקת של החומרים מראש. מצב החשיבה שמרחיב פרומפטים מוגבל רק לשלוש משימות מתוך השש, ואינו נתמך בעריכת וידאו קיימת או בשילוב וידאו ותמונה. התיעוד הרשמי תומך באנגלית בלבד, ואין שום נתונים על התמודדות עם טקסט בעברית. משקל הקבצים והצורך בהרחבות קומפילציה ייעודיות לקרנלים של תשומת לב הופכים כל פריסה לפרויקט דבופס לא קטן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך בודד?

ההגדרות של המפתחים דורשות שמונה כרטיסי מסך. אפשר להפעיל פריקת זיכרון למעבד כדי לחסוך מקום, אבל המודל שוקל מעל 51 גיגה ולא ירוץ על חומרה צרכנית רגילה.

מה מוסיף מצב החשיבה בזמן ההרצה?

הדגל think מפעיל חשיבה במודל השפה לפני הרינדור. הוא מייצר פרומפט מפורט שמפענח את כוונת המשתמש, מה שעוזר בדיוק הסצנה אבל מאריך את זמן העבודה.

האם המודל מבין הנחיות בעברית?

הכרטיס מגדיר תמיכה באנגלית בלבד. פרומפטים בעברית צפויים להיכשל או לתת תוצאות ירודות, ולכן יש לתרגם את ההנחיות לאנגלית לפני השליחה.

איך מריצים

קובצי המשקולות תופסים 51.5 גיגה בפורמט bfloat16 על פני 56 קבצים. סקריפטי ההרצה של הפרויקט מוגדרים מראש לשמונה כרטיסי מסך באמצעות torchrun, כך שאין כאן אשליה שמדובר במשהו שרץ על תחנת עבודה ביתית רגילה.

בפועל אפשר להריץ אותו עם Flash Attention, SageAttention או Flex-Block-Attention לצד מנגנוני DeepCache ופריקת זיכרון לזיכרון המרכזי של המחשב. פריקת הזיכרון לראם קריטית אם מנסים לרדת בכמות הוידאו ראם, אבל היא מאטה את קצב ההסקה בצורה משמעותית. מי שאין לו שרת ענן עם אשכול מאיצים חזק יעדיף לחכות לממשק שירות מנוהל.

pip install -U huggingface_hub
hf download tencent/HY-OmniWeaving

הקבצים

56 קבצים במאגר, 51.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other בכרטיס המודל, והקוד נשען על תנאי השימוש של HunyuanVideo. לא מדובר ברישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י, ולכן אסור להניח שמותר להשתמש בו במוצר מסחרי בלי לעבור על תנאי השימוש המדויקים במאגר של טנסנט.

הרישיון המלא בעמוד המודל ↗