GPT
L

LTX-2.3-GGUF

קוד פתוח

unslothother2026-03-05

  • ggml
  • gguf
  • image-to-video
  • unsloth
  • text-to-video

גרסת קוונטיזציה מכווצת למודל של לייטריקס, שמייצר וידאו יחד עם סאונד מסונכרן מתמונה וטקסט. המטרה כאן היא להריץ מודל של 22 מיליארד פרמטרים על חומרה מקומית בלי לקרוס.

  • 1001 GBמשקל הקבצים
  • 201,933הורדות בחודש
  • 560לייקים

מה זה

המאגר הזה מכיל המרות GGUF של מודל הווידאו LTX-2.3 מבית לייטריקס הישראלית. מדובר במודל מבוסס DiT בגודל 22 מיליארד פרמטרים, שמייצר סרטונים כולל פס קול תואם מתוך תמונת מקור והנחיית טקסט. המאגר מציע שתי גרסאות בסיס עיקריות, גרסת dev שדורשת לפחות 20 צעדים כדי לקבל פלט איכותי, וגרסת distilled מהירה שמסוגלת לייצר תוצאה סבירה בתוך 4 עד 8 צעדים בלבד.

אנשי Unsloth יישמו כאן שיטה שמעלה שכבות קריטיות לרמת דיוק גבוהה יותר בזמן הקוונטיזציה כדי למנוע את הירידה החדה באיכות שבדרך כלל רואים במודלי וידאו דחוסים. בפועל, החבילה כוללת לא רק את משקולות המודל עצמו אלא גם מקודדי תמונה וקול, ומודלים לחידוד והגדלת רזולוציה.

מתאים ל

  • הנפשת תמונות עם סאונד

    יצירת קליפים קצרים הכוללים פס קול תואם מתוך תמונת סטילס יחידה.

  • בדיקות רעיוניות מקומיות

    שימוש בגרסת ה־distilled לבדיקת רעיונות בתוך 4 צעדים בלי לחכות.

  • אימון LoRA לתנועה וסגנון

    גרסת ה־dev פתוחה ומאפשרת אימון שכבות התאמה אישית על חומרה מקומית.

איפה זה נופל

היוצרים מודים שהסאונד שנוצר סובל מאיכות נמוכה יותר כאשר מדובר בצלילי רקע ללא דיבור אנושי. בנוסף, המודל רגיש מאוד לניסוח ההנחיה, ולעיתים קרובות מפספס פרטים מהטקסט אם הם לא נכתבו בדיוק בסגנון שאליו הוא רגיל.

קיימות גם מגבלות טכניות קשיחות. מידות הרוחב והגובה של הסרטון חייבות להתחלק ב־32 בדיוק, ומספר הפריימים חייב להיות כפולה של שמונה ועוד פריים אחד נוסף. אם הקלט שלכם חורג מזה, תצטרכו לחתוך או למלא את השוליים ידנית.

שאלות
נפוצות

באיזו גרסה עדיף להשתמש, dev או distilled?

זה תלוי במטרה שלכם. גרסת ה־distilled מתאימה ליצירה מהירה של סקיצות ב־4 עד 8 צעדים בלבד, בעוד שגרסת ה־dev איטית יותר ודורשת 20 צעדים ומעלה, אבל מייצרת תוצאה מדויקת ופוטוגנית בהרבה. זרימת העבודה המומלצת משלבת ביניהן, יצירת בסיס מהיר וחידוד עם LoRA.

למה הווידאו יוצא מעוות או נכשל ברינדור?

המודל דורש ממדי פיקסלים מדויקים מאוד. אם הגובה או הרוחב לא מתחלקים ב־32, או אם מספר הפריימים לא מתאים למשוואה של שמונה ועוד אחד, התהליך ייכשל או ייצר תוצאה גרועה. הקפידו להגדיר מידות תקניות מראש בתוך הממשק.

איך מריצים

ההרצה המקומית מתבצעת כרגע דרך ComfyUI יחד עם התוסף ComfyUI-GGUF, והקובץ שמצורף לפרויקט כבר מכיל את סביבת העבודה המוכנה. צריך להוריד את קובץ המודל המכווץ, את מודל השפה gemma-3-12b שמקודד את הטקסט, ורכיבי VAE ייעודיים לתמונה ולסאונד.

למרות שמדובר בקבצים מכווצים, המודל המקורי שוקל 22B וכולל רכיבים נלווים רבים. תזדקקו לכרטיס מסך מודרני וחזק עם כמות זיכרון גדולה, מעל 16 גיגה־בייט בגרסאות הקלות ויותר מזה בשביל פלטים ברזולוציה מלאה. אם אתם צריכים רק כמה סרטונים בודדים לבדיקה, פנייה ישירה ל־API של לייטריקס תחסוך את ההורדה והתחזוקה המורכבת.

ollama run hf.co/unsloth/LTX-2.3-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

74 קבצים במאגר, 1001 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ואינו רישיון קוד פתוח סטנדרטי. הוא מפנה לתנאי השימוש הישירים של לייטריקס במסמכי הפרויקט. לפני שילוב המודל בשירות מסחרי או הפצה במוצר, חובה לעיין ברישיון המקורי ולוודא האם קיימות מגבלות על שימוש מסחרי או דרישות תשלום על נפח פעילות.

הרישיון המלא בעמוד המודל ↗