GPT
Q

qwen3-4b-Z-Image-Engineer

קוד פתוח

BennyDaBallapache-2.02025-12-12

  • gguf
  • z-image-turbo
  • prompt-engineering
  • qwen3
  • heretic

המודל הזה הופך רעיונות קצרים לפרומפטים מפורטים לתמונות. הוא עוקף את הסירובים הרגילים של מודלי בסיס ויודע להשתלב ישירות כטקסט אנקודר בתוך תהליכי יצירה מקומיים.

  • 27.1 GBמשקל הקבצים
  • 1,755הורדות בחודש
  • 184לייקים

מה זה

מדובר במודל ממוזג שמבוסס על גרסת Qwen3-4B-Instruct-2507, שעבר אימון ייעודי להרחבת פרומפטים עבור מחוללי תמונות. במקום להקיא מילות מפתח חסרות הקשר כמו איכות שמונה קיי, הוא בונה פסקאות תיאוריות שמפרטות תאורה, מרקם עור וזוויות צילום. שינוי מרכזי שנעשה בגרסה הזו הוא הסרת שמות של מותגי מצלמות מנתוני האימון, מה שמונע ממנו לייצר בטעות מצלמה פיזית בתוך הסצנה, והחלפתם באופטיקה מדויקת כמו אורך מוקד ומפתח צמצם.

היוצר העביר את המודל תהליך להורדת חסימות. במבחני סירוב של תיאורי תמונות, שיעור הסירובים צנח מציון של מאה מתוך מאה במודל המקורי לעשרים ושלוש מתוך מאה בלבד. בנוסף, הוא מתפקד כתחליף תואם לאנקודר טקסט מסוג קליפ בתהליכי Z-Image Turbo, כך שאפשר להשתמש בו ישירות בשלב יצירת התמונה כדי לקבל מגוון רחב יותר מאותו סיד.

מתאים ל

  • הרחבת פרומפטים בקומיקאי

    חיבור ישיר לתוסף ComfyUI כדי לייצר תיאורי סצנה מורכבים עם הגדרות עדשה ותאורה מרעיון קצר.

  • החלפת אנקודר טקסט

    שימוש במודל כתחליף לאנקודר של Z-Image Turbo כדי לקבל מגוון סגנוני רחב יותר על אותו סיד.

  • עידון שיחתי של תמונות

    שיחה מרובת שלבים לשינוי סגנון ותאורה מבלי לאבד את נושא התמונה המקורי, תודות לזיכרון הקשר משופר.

איפה זה נופל

המודל רחוק מלהיות מושלם ועדיין מסרב לבקשות בכעשרים ושלושה אחוזים מהמקרים שנבדקו. היוצר מזהיר בפירוש שהוא עלול להמציא פרטים או לפתח אובססיה מוזרה לזוויות צילום מזווית נמוכה מאוד, מה שמכונה מבט תולעת. כמו כן, הוא תוכנן לעבוד בלי פרומפטים שליליים, כך שאם סביבת העבודה שלכם נשענת על שלילת מאפיינים, תצטרכו לשנות גישה.

אותה משפחה

qwen3-4b-Z-Image-Engineer יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסנן בקשות ליצירת תמונות?

הסינון נחלש בצורה דרסטית בהשוואה למודל המקור, אבל הוא לא בוטל לגמרי. לפי בדיקות היוצר שיעור הסירובים עומד על עשרים ושלוש מתוך מאה, כך שהוא עדיין עלול לדחות בקשות מסוימות.

איזו גרסה כדאי להוריד למחשב מק?

אם אתם על מעבדי אפל, מומלץ לגשת למאגרי ה־MLX שהיוצר פרסם בנפרד. יש שם גרסאות מארבעה ביט למהירות מקסימלית ועד שמונה ביט לדיוק מרבי, שמתאימות במיוחד לארכיטקטורת הזיכרון האחוד.

למה המודל לא מתייחס לפרומפט שלילי?

האימון של המודל נבנה מראש סביב אילוצים חיוביים ותיאור ישיר של מה שרוצים לראות בסצנה. לפי הגישה שבה הוא אומן, שלילת מילים לא מביאה לתוצאות טובות, ולכן הוא מתמקד בתיאור עשיר של הקיים.

איך מריצים

המאגר כולל קבצים מלאים במשקל כולל של עשרים ושבעה נקודה אחד גיגה בייט, ובתוכו תמצאו גרסאות מכווצות בפורמט GGUF ברמות דיוק של ארבע, חמש, שש ושמונה ביט. משתמשי אפל יכולים למצוא גרסאות MLX ייעודיות באותן רמות דיוק במאגרים נפרדים. להרצה מקומית בקוונטיזציה נמוכה מספיק כרטיס מסך ביתי או מחשב מק עם זיכרון צנוע יחסית לגודל ארבעה מיליארד פרמטרים.

אפשר להריץ אותו דרך כלים כמו LM Studio או Ollama, ולהשתמש בתוסף הייעודי ComfyUI-Z-Engineer שמחבר אותו ישירות לשרשרת היצירה שלכם. אם אין לכם עניין להחזיק תהליך מקומי קבוע רק בשביל שכתוב תיאורים, פנייה לשרת עם API תואם OpenAI תחסוך את תפיסת הזיכרון המקומי.

ollama run hf.co/BennyDaBall/qwen3-4b-Z-Image-Engineer:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים ואישיים, לשנות את הקוד והמשקלים, ולהפיץ אותם מחדש בתוך מוצרים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗