GPT
Z

Z-Image

קוד פתוח

Tongyi-MAIapache-2.02026-01-23

  • diffusers
  • safetensors
  • text-to-image
  • en

מודל תמונה מבוסס שנאי של 6.2 מיליארד פרמטרים שלא עבר זיקוק. הוא מיועד למי שרוצה שליטה מדויקת בהנחיות, תמיכה מלאה בטקסט שלילי ובסיס פתוח לאימון עצמאי.

  • 6.2Bפרמטרים
  • 19.1 GBמשקל הקבצים
  • 56,112הורדות בחודש
  • 1,234לייקים

מה זה

מדובר במודל בסיס ליצירת תמונות מטקסט שמשתמש בארכיטקטורת שנאי דיפוזיה בזרם יחיד. בניגוד לגרסת הטורבו המהירה שלו, הוא נשאר ללא זיקוק וללא למידת חיזוק, מה ששומר על מרחב יצירתי רחב ומאפשר שימוש מלא במנגנון הכוונת סיווג חופשי. הוא יודע לעבוד ברזולוציות שנעות בין 512 ל־2048 פיקסלים בכל יחס תצוגה, ומתמודד עם סגנונות מגוונים מצילום ריאליסטי ועד איור.

ההבדל המרכזי מול מודלים מכווצים הוא יכולת התגובה להנחיות מורכבות ושונות גבוהה בין תוצאות. המודל שומר על גיוון בהבעות, תאורה והרכבי סצנות מרובות דמויות, ומגיב בדיוק גבוה להנחיות שליליות שמסירות פגמים או אלמנטים לא רצויים מהפריים.

מתאים ל

  • אימון מודלים מותאמים אישית

    מבנה הבסיס הלא מזוקק הופך אותו לקרקע יציבה לאימון מתאמי LoRA ושכבות שליטה.

  • יצירה עם דרישות בימוי קפדניות

    התמיכה המלאה בהנחיות שליליות מאפשרת לסנן במדויק עיוותים ופרטים לא רצויים.

  • הפקת סצנות מרובות דמויות

    שונות גבוהה בין רנדורים שומרת על הבדלים בתווי פנים ובתאורה בלי תוצאה אחידה.

איפה זה נופל

המודל דורש בין 28 ל־50 צעדי הסקה, ולכן הוא איטי משמעותית מגרסאות מזוקקות. האיכות החזותית הראשונית שלו מוגדרת גבוהה אך נמוכה מזו של גרסת הטורבו שעברה למידת חיזוק. בנוסף, הוא תומך באנגלית בלבד, כך שהזנת הנחיות בעברית לא תניב תוצאות צפויות בלי תרגום מקדים.

שאלות
נפוצות

האם כדאי להעדיף אותו על פני גרסת הטורבו?

זה תלוי במטרה. הטורבו מייצר תמונות ב־8 צעדים עם איכות חזותית גבוהה יותר מהקופסה, אך נועל את היכולת להשתמש בהנחיות שליליות, אינו גמיש להתאמות ומוגבל בגיוון התוצאות.

האם אפשר לשלוח לו הנחיות בעברית?

לא. המודל אומן ותומך בשפה האנגלית בלבד, ולכן תצטרכו לתרגם כל הנחיה לאנגלית לפני שליחתה למודל.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־19.1 גיגה בייט, כך שצריך כרטיס מסך עם זיכרון וידאו נדיב של 24 גיגה בייט לפחות כדי לטעון אותו ולהריץ הסקת מסקנות מקומית דרך ספריית diffusers. תהליך היצירה דורש בין 28 ל־50 צעדים עם סולם הנחיה של 3.0 עד 5.0, מה שאומר שזמן היצירה לתמונה בודדת לא יהיה מיידי.

אם אתם צריכים רק תמונות מהירות בזמן אמת בלי התאמות מיוחדות, עדיף להשתמש בגרסת הטורבו שמסתפקת ב־8 צעדים או לפנות לפתרון מנוהל. המודל הזה מתאים בעיקר למי שמתכנן לאמן מתאמי LoRA או לבנות סביבו שכבות שליטה מבניות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Tongyi-MAI/Z-Image")
img = pipe("a photo").images[0]

הרישיון

הקוד והמשקלים מופצים תחת רישיון אפאצ'י 2.0 המלא. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, לאמן עליו גרסאות משלכם ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗