GPT
H

Helios-Distilled

קוד פתוח

BestWishYshapache-2.02026-02-23

  • diffusers
  • safetensors
  • text-to-video
  • en

מודל פתוח ליצירת וידאו מטקסט שמפיק סרטונים ארוכים בקצב של עד 19.5 פריימים לשנייה על מאיץ בודד. הוא מדלג על שיטות ייצוב מקובלות ומכוון לריצה מהירה בלי לאבד את רצף התמונה.

  • 14Bפרמטרים
  • 128 GBמשקל הקבצים
  • 1,292הורדות בחודש
  • 50לייקים

מה זה

הארכיטקטורה מבוססת על 14 מיליארד פרמטרים ומייצרת וידאו במקטעים של 33 פריימים, מה שמאפשר להגיע לסרטונים של דקה ומעלה ברצף. בניגוד לגרסת הבסיס שמשתמשת בחיזוי רעש סטנדרטי ודגימה איטית, גרסת הדיסטיליזציה הזו עוברת לחיזוי נקודת ההתחלה ודחיסה של שלבי הדגימה. התוצאה היא מודל שמכוון ליעילות מקסימלית בזמן ריצה, עם תמיכה ביצירת וידאו מטקסט, תמונה או וידאו קיים.

המפתחים ויתרו בכוונה על מנגנוני זיכרון או שמירת מצבי ביניים ומדווחים על קצב של 19.5 פריימים לשנייה על כרטיס H100 יחיד, או כעשרה פריימים על מעבדי אסנד. בפועל, המשמעות של המספרים האלה היא יצירת וידאו בקצב שמתקרב לזמן אמת בלי להזדקק לאשכול שרתים ענק רק בשביל לקבל קליפ של עשר שניות.

מתאים ל

  • הפקת וידאו מטקסט באנגלית

    יצירת סרטונים באורך דקה ומעלה בקצב דגימה מהיר ישירות מתיאור טקסטואלי מפורט.

  • בדיקות מקומיות על מחשב ביתי

    ריצת מודל של 14 מיליארד פרמטרים על זיכרון מסך של שישה גיגה בלבד בעזרת טכניקת פריקה מובנית.

  • עיבוד וידאו מקבילי בענן

    פריסה על מספר מאיצים במקביל תוך שימוש במנגנוני חלוקת קשב ייעודיים להאצת תהליכים.

איפה זה נופל

המודל אומן בעיקר על טקסט לווידאו, ובכרטיס מודים בפירוש שיכולות תמונה לווידאו או וידאו לווידאו פחות טובות. לעיתים קרובות המקטעים הראשונים יוצאים קפואים לחלוטין, ותצטרכו לשחק ידנית עם מקדמי רעש או לדלג על המקטע הראשון בקוד. בנוסף, הוא תומך בהנחיות באנגלית בלבד, וכל אורך סרטון שאינו כפולה של 33 פשוט מעוגל כלפי מעלה בלי שאלות.

שאלות
נפוצות

האם אפשר להריץ את המודל עם פרומפטים בעברית?

המודל הוכשר ומוגדר רשמית עבור אנגלית בלבד. אם תזינו הנחיות בעברית סביר להניח שתקבלו תוצאות משובשות או חוסר הבנה מוחלט של התיאור. הפתרון היחיד הוא לתרגם את ההנחיות לאנגלית לפני שליחתן למודל.

למה הסרטון שנוצר מתחיל מתמונה קפואה כשמנסים תמונה לווידאו?

היכולת הזו נשענת על אימון מטקסט בלבד ונחשבת נחותה יותר במודל. כדי להתגבר על הקיפאון במקטעים הראשונים, המפתחים ממליצים להפעיל בקוד את האפשרות לדלג על המקטע הראשון או להגדיל את ערכי הרעש שמוגדרים בתחילת הריצה.

מה ההבדל בין גרסה זו לגרסת הבסיס של המודל?

גרסת הדיסטיליזציה הזו עברה תהליך ייעול ודחיסה שמאפשר לה לייצר פריימים בפחות צעדי חישוב ובשיטת דגימה אגרסיבית יותר. היא מספקת מהירות גבוהה משמעותית ביחס לגרסת הבסיס, אם כי הדבר עלול לבוא על חשבון חלק מאיכות התמונה המקורית.

איך מריצים

כדי להריץ אותו מקומית צריך לפנות המון מקום בדיסק, סביב 128 גיגה בייט רק למשקולות, וכרטיס מסך רציני. למרות הגודל, הקוד תומך בטכניקת הורדה למעבד ולזיכרון המערכת שמורידה את דרישת זיכרון המסך לכשישה גיגה בלבד, מה שמאפשר להריץ אותו אפילו על מחשב ביתי אם יש לכם מספיק סבלנות.

אם אתם צריכים תפוקה מהירה לסביבת ייצור, תצטרכו שרת עם מאיצים מתקדמים כמו H100 או מערך מרובה כרטיסים שמנצל חלוקת הקשר. לשימוש מזדמן או לבדיקות ראשוניות, החזקה של שרת כזה תעלה המון כסף בענן, ובמקרה כזה עדיף לפנות לפתרונות אירוח קיימים או שירותי ענן שמציעים את המודל לפי שימוש.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("BestWishYsh/Helios-Distilled")
img = pipe("a photo").images[0]

הקבצים

35 קבצים במאגר, 128 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ׳י שתיים אפס, רישיון קוד פתוח מתירני מאוד. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗