GPT
H

HunyuanVideo-1.5

קוד פתוח

tencentother2025-11-18

  • HunyuanVideo-1.5
  • diffusers
  • safetensors
  • text-to-video
  • image-to-video

הפקת וידאו מטקסט או תמונה עם ארכיטקטורה של 8.3B פרמטרים שמיועדת לרוץ על כרטיסים ביתיים. הוא פותר את צוואר הבקבוק החישובי הכבד של מודלי וידאו פתוחים קודמים.

  • 346 GBמשקל הקבצים
  • 1,909הורדות בחודש
  • 1,035לייקים

מה זה

מדובר במודל ליצירת וידאו מטקסט ומתמונה שמבוסס על Diffusion Transformer ודחיסת VAE תלת ממדית. הוא יוצר במקור סרטונים ברזולוציות 480p או 720p ומשלב רשת super-resolution ייעודית שמשדרגת את התוצאה ל־1080p תוך תיקון עיוותים. התמיכה בשפות מוגדרת לאנגלית ולסינית, והטקסט מעובד דרך מנגנון שמתחשב בצורת הגופן כדי לדייק בייצוג של סימנים.

ההבדל המשמעותי לעומת מודלים קודמים מגיע מהשילוב של מנגנון קשב מסוג SSTA, שגוזם בלוקים מיותרים ברצף הווידאו. לפי הנתונים, המנגנון הזה מאיץ את הפקת הווידאו בפי 1.87 בהשוואה ל־FlashAttention-3 על סרטון של עשר שניות ב־720p. יש גם גרסאות מזוקקות צעדים ו־CFG, שמאפשרות להפיק וידאו בפחות צעדי דגימה.

מתאים ל

  • הנפשת תמונות סטילס

    מודל 480p I2V המזוקק מייצר תנועה מתמונת מקור בתוך 75 שניות על RTX 4090.

  • עבודה בתוך ComfyUI

    אינטגרציה רשמית ל־ComfyUI שמאפשרת לבנות פייפליין מקומי ללא כתיבת קוד עצמאי.

  • שדרוג סרטונים ל־1080p

    רשת ה־super resolution הנלווית מאפשרת לתקן עיוותים ולהעלות חדות של פלט קיים.

איפה זה נופל

האיכות הסופית תלויה מאוד בהרחבת הפרומפטים. המפתחים מציינים במפורש שברירת המחדל מפעילה שכתוב פרומפטים דרך מודלי שפה חיצוניים כמו Qwen, ובלעדיו איכות הווידאו יורדת. בנוסף, sparse attention דורש חומרה ברמת H-series של NVIDIA ולא נתמך בכרטיסים פשוטים, וטכנולוגיות האצה מסוימות מבטלות זו את זו, כמו SageAttention שמשבית את Flex-Block-Attention.

שאלות
נפוצות

האם המודל מבין פרומפטים בעברית?

לא. המודל הוכשר ונתמך רשמית באנגלית ובסינית בלבד, וכולל מקודד טקסט ייעודי לשפות האלה. שימוש בעברית ידרוש תרגום מוקדם של הטקסט.

אפשר להריץ אותו על מחשב אישי עם כרטיס אחד?

כן, בתנאי שיש כרטיס NVIDIA עם לפחות 14GB זיכרון ומערכת הפעלה Linux. הפעלת מודלי הזיקוק ב־480p תאפשר לכם להפיק תוצאות סבירות בזמן ריצה הגיוני.

איך מריצים

הכרטיס דורש כרטיס של NVIDIA עם תמיכת CUDA ומערכת הפעלה Linux בלבד. אם מפעילים model offloading לזיכרון ה־CPU, רף הכניסה המוצהר הוא 14GB של VRAM, כאשר כלים קהילתיים מדווחים שאפשר לרדת אפילו ל־6GB. יש גרסת 480p מזוקקת שרצה ב־8 עד 12 צעדים ומייצרת סרטון על גבי RTX 4090 יחיד בתוך 75 שניות.

למרות הדרישות הצנועות לכרטיס מסך, כלל הקבצים שוקלים 346GB על פני עשרות תיקיות, ומנגנון ה־offloading טוחן את ה־RAM הרגיל של המחשב. אם אין לכם תחנת עבודה ייעודית וחיבור מהיר, תחזוקה מקומית תהיה סיוט שעדיף להחליף ב־API חיצוני.

pip install -U huggingface_hub
hf download tencent/HunyuanVideo-1.5

הקבצים

46 קבצים במאגר, 346 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון סומן כ־other. זה אומר שלא מדובר ברישיון קוד פתוח סטנדרטי כמו MIT או Apache, ואי אפשר להניח שיש היתר מסחרי חופשי. לפני שמשלבים את המודל או את המשקלים במוצר, חייבים לקרוא את קובץ התנאים המדויק במאגר כדי לוודא שאין הגבלות שימוש או תנאי סף על הכנסות.

הרישיון המלא בעמוד המודל ↗