GPT
Z

Z-Image-Turbo

קוד פתוח

Tongyi-MAIapache-2.02025-11-25

  • diffusers
  • safetensors
  • text-to-image
  • en

מודל תמונה מבוסס דיפוזיה שמייצר תמונות בשמונה צעדים בלבד. הוא פונה למי שצריך תמונות ריאליסטיות עם טקסט באנגלית ובסינית, בריצת הסקה מהירה על כרטיס ביתי.

  • 6.2Bפרמטרים
  • 30.6 GBמשקל הקבצים
  • 693,909הורדות בחודש
  • 5,221לייקים

מה זה

מדובר במודל של 6.2 מיליארד פרמטרים ממשפחת Z-Image, שעבר זיקוק בעזרת שילוב של שיטת Decoupled-DMD ואימון בלמידת חיזוק. הארכיטקטורה שלו בנויה כ־Single-Stream DiT שמאחדת טקסט, אסימונים סמנטיים ואסימוני תמונה לרצף קלט אחד. המטרה של התכנון הזה היא לנצל כל פרמטר עד הסוף כדי להגיע לתוצאות גבוהות בלי לפצל את עיבוד הטקסט והתמונה לערוצים נפרדים.

הייחוד של גרסת הטורבו הזו הוא היכולת לייצר פלט בשמונה צעדי חישוב בלבד, ללא צורך ב־CFG בזמן ריצה. לפי נתוני מבחני ההעדפה האנושית של החברה, הוא מתחרה במודלים מובילים תוך שמירה על יצירת טקסט דו-לשוני מדויק ברמת התמונה, תחום שבו הרבה מודלים פתוחים בגודל הזה עדיין מתקשים.

מתאים ל

  • הפקת תמונות בזמן אמת

    שמונה צעדי הסקה מאפשרים להציג תמונה למשתמש בלי המתנה ארוכה על כרטיסי מסך צרכניים.

  • עיצוב שלטים ומודעות

    שילוב אותיות מדויק באנגלית ובסינית על גבי תמונות ריאליסטיות ללא עיוותי טקסט.

  • הסקה מקומית על מחשב יחיד

    דרישת זיכרון של 16GB שמאפשרת לפעול עצמאית ללא תלות בשרתי ענן חיצוניים.

איפה זה נופל

בטבלת ההשוואה של הפרויקט מוגדר במפורש שהגיוון של גרסת הטורבו נמוך, מה שאומר שהיא נוטה לחזור על קומפוזיציות דומות. בנוסף, יכולת הכוונון העדין מוגדרת כלא רלוונטית, כך שאם התוכנית שלכם כוללת אימון LoRA מותאם אישית או התאמה לסגנון מותג, עדיף לפנות למודל הבסיס ולא לטורבו. התמיכה בטקסט ובשפה מתמקדת רק באנגלית ובסינית, כך שאין כאן מענה לפרומפטים או כיתובים בעברית.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב ביתי בלי שרת ענן?

כן, כל עוד יש לכם כרטיס מסך עם לפחות 16GB זיכרון ייעודי. הקבצים שוקלים קצת יותר מ־30 ג'יגה בייט, כך שצריך גם מקום פנוי בדיסק וגרסה עדכנית של ספריית diffusers שמותקנת ממאגר הגיטהאב.

האם המודל מתאים לאימון על סגנון אישי של החברה?

לא, היוצרים מציינים שהגרסה המזוקקת הזו לא מיועדת לכיול מחדש. למשימות שדורשות פיין-טיונינג עדיף להוריד את גרסת הבסיס הרגילה, שכוללת יותר גיוון ומיועדת לעיבוד והתאמה.

האם הוא מבין הנחיות או מציג טקסט בעברית?

לא, הכרטיס מציין תמיכה רק באנגלית ובסינית. הוא לא אומן להבין פרומפטים בשפות אחרות וגם לא יידע לרנדר אותיות בעברית על גבי התוצר הסופי.

איך מריצים

כדי להריץ אותו, מורידים את המשקלים שתופסים 30.6 ג'יגה בייט ומתקינים את ספריית diffusers ישירות מהמקור ב־GitHub, מאחר שהתמיכה במבנה שלו דורשת את הקוד המעודכן ביותר. המודל נכנס לכרטיסי מסך עם 16GB זיכרון ייעודי, ומפיק זמני תגובה של פחות משנייה על כרטיסי שרת מסוג H800.

אם אתם מחזיקים כרטיס עם פחות זיכרון, או צריכים שירות שפועל לסירוגין בלי לתחזק שרת קבוע בענן, עדיף להשתמש בנקודות הקצה של הקהילה או בדמו המקוון. אין טעם להיאבק בהגדרות מקומיות אם היקף השימוש שלכם נמוך מכדי להצדיק חומרה ייעודית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Tongyi-MAI/Z-Image-Turbo")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה מחדש כמעט ללא הגבלות. אתם יכולים לשלב אותו במוצר פנימי או מסחרי, בתנאי שאתם שומרים על הודעת זכויות היוצרים והרישיון המקורי בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗