GPT
Z

Z-Image-GGUF

קוד פתוח

unslothapache-2.02026-01-27

  • ggml
  • gguf
  • unsloth
  • quantized
  • text-to-image

גרסת GGUF מכווצת למודל התמונות Z-Image שמיועדת להרצה מקומית. Unsloth ארזו אותו בשיטת Dynamic 2.0 ששומרת על דיוק גבוה בשכבות הקריטיות.

  • 89.8 GBמשקל הקבצים
  • 35,424הורדות בחודש
  • 193לייקים

מה זה

מדובר במודל בסיס פתוח ליצירת תמונות מטקסט מסוג Single-Stream Diffusion Transformer, שמגיע בגרסה הזו אחרי כימות שנעשה בעזרת הכלים של ComfyUI-GGUF. המודל אינו מזוקק, מה שאומר שהוא שומר על כל אותות האימון המקוריים ותומך באופן מלא ב־CFG (הנחיה ללא מסווגים) ובהנחיות שליליות. המטרה כאן היא לתת שליטה עמוקה יותר על הפרומפט וגיוון רחב בקומפוזיציות, זוויות תאורה ותווי פנים בין סידים שונים.

ההבדל העיקרי מול גרסאות הטורבו המהירות הוא ביכולת הכוונון והשליטה. בזמן שדגמי טורבו דורשים בדרך כלל מעט צעדים אך מאבדים את התמיכה ב־CFG ובפרומפטים שליליים, כאן מקבלים בסיס שמתאים גם לאימוני המשך של LoRA או הרחבות מבניות כמו ControlNet. המודל תומך ביצירת תמונות ברזולוציות שנבלעות בטווח שבין 512 ל־2048 פיקסלים בכל יחס תמונה.

מתאים ל

  • אימון מודלי LoRA ייעודיים

    מבנה הבסיס הלא מזוקק שומר על אותות האימון המלאים ומאפשר התאמה אישית של סגנונות.

  • יצירת תמונות מורכבות בסטודיו

    התמיכה המלאה ב־CFG ובפרומפט שלילי נותנת שליטה מדויקת בפרטים ומונעת ארטיפקטים.

  • הפקת סצנות מרובות דמויות

    המודל מספק גיוון גבוה בתווי פנים, תאורה וקומפוזיציה בריצות שונות.

איפה זה נופל

זה לא כלי שמתאים לייצור מהיר בזמן אמת. בגלל הצורך ב־28 עד 50 צעדים, כל תמונה לוקחת זמן משמעותי לעיבוד, בניגוד לדגמי טורבו שסוגרים עניין בשמונה צעדים בלבד. בנוסף, המודל אומן והוגדר עבור השפה האנגלית בלבד, כך שפרומפטים בעברית ידרשו תרגום מוקדם כדי להגיע לתוצאות סבירות. המאגר מכיל עשרות גיגבייטים של קבצים מפוצלים ומחייב הבנה טכנית בהגדרת סביבת העבודה כדי לחבר אותו נכון.

שאלות
נפוצות

מה ההבדל בין המודל הזה לגרסת הטורבו?

גרסת הטורבו רצה בשמונה צעדים בלבד אבל מוותרת על CFG, פרומפט שלילי וגמישות בכוונון. המודל הזה דורש בין 28 ל־50 צעדים, אבל מאפשר שליטה מדויקת על התוכן והסגנון ומתאים לאימוני המשך.

האם המודל מבין הנחיות בעברית?

המודל מוגדר לשפה האנגלית בלבד. אם תכתבו פרומפטים בעברית הוא יתקשה להבין את ההקשר, ולכן צריך לתרגם את התיאור לאנגלית לפני השליחה.

איך מריצים

המודל מחולק לקובצי GGUF במשקל כולל של כמעט 90 גיגה בייט ברמת המאגר המלא, שכולל גרסאות שונות להורדה. כדי להריץ תמונה בודדת צריך לבחור קובץ כימות ספציפי שמתאים לזיכרון הקיים, ולטעון אותו בסביבות שתומכות בפורמט כמו ComfyUI עם תוסף מתאים או דרך diffusers. המודל דורש בין 28 ל־50 צעדי הסקה עבור כל תמונה עם ערכי Guidance Scale של 3.0 עד 5.0.

אם אין לכם כרטיס מסך חזק עם מספיק זיכרון וידאו שיכול להחזיק מודל כזה שלם בלי לזחול, עדיף להשתמש ב־API מרוחק או בדמו אונליין. מודל לא מזוקק דורש פי כמה וכמה משאבי חישוב וזמן בכל ריצה בהשוואה לדגמים שעברו זיקוק.

ollama run hf.co/unsloth/Z-Image-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה מחדש, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗