GPT
J

JoyAI-Echo

קוד פתוח

jdopensourceother2026-06-02

  • diffusers
  • safetensors
  • image-to-video
  • video-generation
  • audio-video-generation

מודל שמייצר וידאו ואודיו מסונכרנים יחד ומחזיק עקביות של דמויות וקול לאורך סצנות. שווה להסתכל עליו כשנמאס מקליפים קצרים ומנותקים בלי סאונד תואם.

  • 19Bפרמטרים
  • 133 GBמשקל הקבצים
  • 17,232הורדות בחודש
  • 178לייקים

מה זה

מדובר במערכת שמיועדת ליצירת וידאו מבוסס רפרנס, עם כמעט 19 מיליארד פרמטרים. היא מקבלת טקסט, פריים פותח, ועד שבעה חריצי זיכרון של תמונות וסאונד שמגדירים את הדמות, הקול והסביבה. הרעיון הוא לשמור על אותו פרצוף ואותו צליל קול בכמה שוטים נפרדים, במקום להגריל אותם מחדש בכל ריצה.

הבסיס נשען על LTX-2.3, אבל היצירה רצה דרך דוגם DMD בשמונה צעדים בלבד, יחד עם יצירת אודיו ווידאו בצנרת אחודה. במקום לייצר סרטון אילם ולשבור את הראש בחיבור קול בנפרד, מקבלים את התנועה והסאונד מאותו תהליך חישוב.

מתאים ל

  • יצירת סצנות מרובות שוטים

    שבעת חריצי הזיכרון מאפשרים לשמור על מראה הדמות והקול לאורך סרטון שלם.

  • הפקת וידאו עם סאונד מובנה

    הפקת אודיו ווידאו יחד חוסכת הוספת דיבוב ואפקטים קוליים בשלב עריכה נפרד.

  • רינדור מהיר יחסית בחומרה

    דוגם ה־DMD מסיים יצירה בשמונה צעדים בלבד, מה שמקצר את זמן הרינדור לכל שוט.

איפה זה נופל

זה מודל מורכב להקמה שלא עובד מחוץ לקופסה רק עם שורת קוד אחת ב־diffusers. חובה למשוך ידנית את Gemma 3 12B ממאגר נפרד, ואין בכרטיס נתוני ביצועים כמותיים שמראים עד כמה הקולות והפרצופים נשמרים טוב בהשוואה למודלים אחרים. כמות זיכרון הווידאו הנדרשת גדולה מאוד, ולמרות הדגימה ב־8 צעדים, צוואר הבקבוק בחומרה מקומית יהיה העברת המשקלים והרצת מקודד הטקסט.

שאלות
נפוצות

האם אפשר להריץ את זה על כרטיס RTX 4090 יחיד?

כן, אבל רק בגרסאות המכווצות כמו FP4 או FP8. תצטרכו להפעיל את אופציית ה־offload לשכבות ה־DiT ולדחוס את ה־VAE, כי צריך לטעון גם את המודל עצמו וגם את Gemma 3 12B.

איך המודל יודע איזה קול ואיזו דמות לשים בסרטון?

הוא מקבל עד שבעה חריצי זיכרון שמכילים תמונות וקטעי אודיו כרפרנס. המידע הזה נטען כהתניה לצד הפרומפט הטקסטואלי, וכך נשמר הרצף הוויזואלי והקולי.

איך מריצים

אין פה קובץ אחד קטן שזורקים לקולאב. כלל הקבצים שוקלים 133 גיגה בייט, אבל הם מחולקים לגרסאות: BF16 ששוקלת 46.14 גיגה בייט, FP8 בגודל 27.62 גיגה בייט, וגרסת FP4 ששוקלת 22.81 גיגה בייט. בנוסף, חובה להוריד בנפרד את מקודד הטקסט Gemma 3 12B IT, מה שמגדיל את צריכת הזיכרון הכוללת.

בשביל גרסת ה־BF16 צריך חומרת שרתים רצינית עם כרטיסי A100 או H100. גרסאות ה־FP8 וה־FP4 כוללות תמיכה בפריקת שכבות ל־RAM ופירוק ה־VAE לאריחים, מה שמאפשר להריץ על כרטיסי קצה עם 24 גיגה בייט VRAM. אם אתם צריכים רק כמה שוטים מהירים בלי לבנות תשתית של עשרות גיגות, עדיף להמתין לשירות API מנוהל.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("jdopensource/JoyAI-Echo")
img = pipe("a photo").images[0]

הקבצים

34 קבצים במאגר, 133 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מבוסס על LTX-2 וכפוף להסכם הרישיון הקהילתי של חברת Lightricks הישראלית. כל זכויות היוצרים וההגבלות המקוריות נשמרות. לפני שמשלבים אותו במוצר מסחרי, חייבים לבדוק ישירות את תנאי הרישיון של LTX-2 כדי לוודא שאינכם חורגים מהמגבלות העסקיות שלו.

הרישיון המלא בעמוד המודל ↗