GPT
H

HunyuanVideo

קוד פתוח

hunyuanvideo-communityרישיון לא דווח2024-12-22

  • diffusers
  • safetensors

מודל פתוח ליצירת וידאו מטקסט שמתאים ישירות לספריית diffusers. הוא נותן גישה מקומית למשקלים בלי להסתבך עם קוד ייעודי של הפרויקט המקורי.

  • 13Bפרמטרים
  • 39.0 GBמשקל הקבצים
  • 28,074הורדות בחודש
  • 58לייקים

מה זה

מדובר בהמרה לא רשמית של משקלי המודל של Tencent לתצורה שנתמכת ישירות בתוך diffusers. במקום להוריד מאגרים מותאמים אישית ולהסתבך עם סביבות ריצה ייעודיות, אפשר למשוך אותו עם שורות קוד בודדות בשפה שכל מפתח בתחום מכיר.

המודל מיועד ליצירת קטעי וידאו קצרים מטקסט, כמו קליפ של 61 פריימים ברזולוציה בסיסית, ישירות לתוך קובץ וידאו. הוא מתבסס על ארכיטקטורת שנאי תלת ממדי שמנתחת את הקשר בין הפריימים לאורך ציר הזמן.

היתרון הגדול של הגרסה הזו מול המשקלים המקוריים הוא הנגישות בתוך המערכת של diffusers, כולל תמיכה מובנית בטכניקות לצמצום צריכת זיכרון כמו פריסה במקטעים של ה־VAE והורדת עומס למעבד, תכונות שהופכות מודל בגודל הזה לאפשרי להרצה.

מתאים ל

  • בדיקות יצירת וידאו

    ניסויים מקומיים ברינדור קטעי וידאו מטקסט ישירות מתוך סקריפטים של פייתון.

  • פיתוח צינורות עיבוד

    שילוב יצירת וידאו בתוך מערכות שכבר בנויות על תשתית diffusers.

  • מחקר על שנאי וידאו

    חקר ארכיטקטורת שנאי תלת ממדי על חומרה מקומית חזקה.

איפה זה נופל

כרטיס המודל לא מציג מדדי ביצועים מסודרים, דוגמאות מגוונות או פירוט על מגבלות התוכן. חוץ מזה, יצירת וידאו מקומית סובלת לעיתים קרובות מעיוותים בתנועה, חוסר עקביות בין פריימים ואיטיות משמעותית בכל פעולת הסקה, במיוחד כשדוחפים זיכרון למעבד. צריך לבדוק היטב את איכות הפלט לפני שבונים עליו משהו שרואה משתמשי קצה.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד חזק?

לא, המשקלים לבדם תופסים 39.0 ג'יגה בייט. תהליך ההסקה דורש כרטיס מסך מקצועי עם נפח זיכרון עצום, אפילו עם פריקת זיכרון למעבד.

מה ההבדל בין זה לבין המאגר המקורי של Tencent?

זהו פיצול קהילתי שממיר את המשקלים למבנה המוכר של ספריית diffusers. זה מאפשר שימוש בפונקציות המובנות של הספרייה בלי קוד חיצוני מסורבל.

איך מריצים

בשביל להריץ אותו צריך חומרת שרתים רצינית. הקבצים שוקלים 39.0 ג'יגה בייט בפורמטים מעורבים של bfloat16 ו־float16, כך שכרטיס מסך ביתי ממוצע פשוט ייחנק מחוסר זיכרון וידאו.

הקוד מחייב שימוש בטכניקות ייעודיות כמו model cpu offload וחלוקת עיבוד התמונה למקטעים כדי לשרוד את שלב הפענוח. אם אין לכם גישה לכרטיס מקצועי עתיר זיכרון, עדיף לחכות לממשקי API חיצוניים במקום לשרוף שעות על שגיאות זיכרון מקומיות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("hunyuanvideo-community/HunyuanVideo")
img = pipe("a photo").images[0]

הרישיון

הרישיון בעמוד לא דווח כלל. המשמעות ברורה, אסור לשלב את המשקלים האלה במוצר מסחרי בלי לבדוק קודם את תנאי השימוש המקוריים של Tencent, שכן מדובר בהמרה קהילתית ללא הבהרה משפטית.

הרישיון המלא בעמוד המודל ↗