GPT
Z

Z-Image-Fun-Lora-Distill

קוד פתוח

alibaba-paiapache-2.02026-02-02

  • videox_fun
  • lora
  • text-to-image

תוספי LoRA שמזקקים יצירת תמונות מבוססות Z-Image לשניים עד שמונה צעדים בלבד וללא CFG. פתרון שנועד לחסוך זמן חישוב בלי לוותר על התאמה לתוספים קיימים.

  • 5.6 GBמשקל הקבצים
  • 11,672הורדות בחודש
  • 175לייקים

מה זה

מדובר באוסף משקולות LoRA שנועדו להאיץ את מודל הבסיס Z-Image על ידי הפחתת כמות הצעדים הנדרשת וביטול הצורך בחישובי CFG, מה שמקצר את זמן היצירה משמעותית. המודלים אומנו מאפס ולא מתבססים על משקולות של Z-Image-Turbo, ומטרתם המרכזית היא לספק תאימות מהירה למודלים נגזרים ולכלים נלווים כמו רשתות בקרה. המאגר כולל מספר גרסאות, כאשר סדרת 2603 מתקנת בעיות של מריחות ותמונות מטושטשות שהופיעו בגרסת 2602 בערכי סיגמא נמוכים מ־0.500, הודות לשימוש באסטרטגיית זמנים אקראית.

בפועל, המשמעות של הפעלת מודל כזה היא פשרה מודעת. ההאצה מ־25 צעדים ל־4 או 8 צעדים משנה את הקומפוזיציה המקורית ומורידה מעט מאיכות הפלט הסופית, אך מאפשרת לשמור על צבעוניות ומרקם עור סבירים בגרסאות המעודכנות. בנוסף, המודל שומר על תאימות מלאה לעבודה עם כלי בקרה חיצוניים כמו זיהוי פוזות, קווי מתאר, עומק ושינוי מקומי של תמונות.

מתאים ל

  • האצת צינורות יצירה

    הורדת זמני ההמתנה ל־4 או 8 צעדים בסביבות עבודה מבוססות ComfyUI בלי להחליף את מודל הבסיס.

  • עבודה עם רשתות בקרה

    שילוב עם מודלי פוזה, עומק ואינפיינטינג ליצירה מונחית ומהירה בעזרת מודלי ControlNet של Z-Image.

  • רינדור מקומי מהיר

    הפקת תמונות ב־2 צעדים לבדיקת רעיונות מיידית על גבי חומרה מקומית תומכת.

איפה זה נופל

המודל מודה בגלוי בירידה באיכות הפלט ובשינוי הקומפוזיציה לעומת יצירה מלאה ב־25 צעדים. גרסאות 2602 סובלות מתמונות מטושטשות בסיגמא נמוכה, וגם בגרסת 2603 של שני צעדים נדרשת תשומת לב מיוחדת לטווחי הסיגמה ולמשקל ה־LoRA כדי לא לקבל תוצאות שבורות. בנוסף, המפתחים ממליצים להישאר עם תזמון פשוט ולא לסמוך על מתזמנים מורכבים. אם התוצר הסופי במוצר שלכם דורש דיוק מרבי בפרטים קטנים או תאימות מלאה לקומפוזיציה המקורית, החיסכון בזמן הריצה יפגע בתוצאה.

שאלות
נפוצות

באיזו גרסה כדאי להשתמש מתוך המאגר?

עדיף לבחור בגרסאות מסדרת 2603 ולא 2602, מכיוון שהן כוללות מנגנון שמונע טשטוש בצעדים מסוימים. אם אתם עובדים ב־ComfyUI, השתמשו בקבצים שמכילים ComfyUI בשם שלהם, והתחילו עם גרסת 8 הצעדים ליציבות לפני שיורדים ל־4 או 2 צעדים.

האם המודל מחליף את Z-Image-Turbo?

לא. המפתחים מציינים במפורש שהמטרה אינה להחליף את גרסת הטורבו, אלא לאפשר יצירה מהירה ותאימות למודלים נגזרים ותוספי LoRA אחרים שכבר נבנו עבור Z-Image.

איך מריצים

ההרצה המקומית מתבצעת דרך שכפול קוד המקור של VideoX-Fun מגיטהאב או ישירות בתוך ComfyUI באמצעות קובצי Safetensors ייעודיים שנמצאים במאגר. צריך להוריד את מודל הבסיס של Z-Image לתיקיית Diffusion Transformer ואת משקולות ה־LoRA לתיקיית המודלים המותאמים, ולהריץ סקריפטים כמו predict_t2i.py עם הגדרת משקל שנע בין 0.7 ל־0.9 וערך CFG קבוע של 1.0. לא מצוינת דרישת זיכרון גרפי מדויקת, אך משקל הקבצים הכולל הוא 5.6 גיגה-בייט והוא מחייב כרטיס שמסוגל לטעון את מודל הבסיס.

הבחירה בין הגרסאות תלויה בצורך המדויק. מי שרוצה מהירות מרבית יבחר בגרסת שניים או ארבעה צעדים, ומי שזקוק ליציבות ועקביות עדיף שישתמש בגרסת 8 צעדים מסדרת 2603. אם אין לכם חומרה שמחזיקה מודלי תמונה מודרניים או שאין צורך בהתאמות פרטיות עם כלי בקרה מורכבים, שירותי ענן חיצוניים יחסכו התעסקות בספריות ובהגדרות מסלולים מקומיות.

pip install -U huggingface_hub
hf download alibaba-pai/Z-Image-Fun-Lora-Distill

הקבצים

76 קבצים במאגר, 5.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המשקולות בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, ללא אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗