GPT
Z

drbaph/Z-Image-Turbo-FP8

קוד פתוח

drbaphapache-2.02025-11-27

  • diffusers
  • comfyui
  • quantization
  • quant
  • fp8

גרסה מכווצת של מודל יצירת תמונות מהיר עם שישה מיליארד פרמטרים. היא חותכת את המשקל לחצי בלי לפגוע כמעט באיכות, כדי שתוכלו לייצר תמונות בשניות בודדות על כרטיס ביתי.

  • 11.5 GBמשקל הקבצים
  • 9,079הורדות בחודש
  • 53לייקים

מה זה

מדובר בגרסת קוונטיזציה של Z-Image-Turbo לדיוקי FP8, ספציפית E4M3FN ו־E5M2. המקור נשען על ארכיטקטורת Single-Stream Diffusion Transformer בהיקף של שישה מיליארד פרמטרים, והגרסה המזוקקת שלו בנויה לייצר תמונות איכותיות בשמונה צעדי חישוב בלבד. הכיווץ הנוכחי מקטין את כל החבילה לכ־11.5 גיגה בייט ומאפשר הרצה מקומית בלי לבלוע את כל זיכרון הווידאו של הכרטיס.

המודל מתמקד ביצירת תמונות מטקסט עם דגש על פוטו-ריאליזם, הצמדות מדויקת להנחיות המשתמש, ורינדור כיתוב ישירות בתוך התמונה באנגלית ובסינית. ההשוואה הגרפית שמצורפת לדף מציגה תמונות שנוצרו ב־BF16 מול FP8, וקשה מאוד להבחין בהבדל ביניהן, מה שאומר שהירידה בדיוק כמעט אינה גובה מחיר ויזואלי.

השילוב בין מספר צעדים נמוך לבין דחיסה ל־8 ביט נותן זמן תגובה קצר מאוד. במקום להמתין עשרות צעדים כמקובל במודלים ישנים יותר, מקבלים פלט מלא בכמה שניות, כשהיתרון המרכזי כאן הוא היכולת להחזיק מודל של שישה מיליארד פרמטרים על חומרה שאינה שרת ייעודי.

מתאים ל

  • יצירת תמונות בזמן אמת

    שמונה צעדי חישוב בלבד מאפשרים קבלת תוצאה כמעט מיידית באפליקציות אינטראקטיביות.

  • שילוב טיפוגרפיה גרפית

    יכולת מובנית לרינדור אותיות ומילים מדויקות באנגלית או בסינית ישירות בתוך הפלט.

  • הרצה מקומית על כרטיס יחיד

    משקל כולל של 11.5 גיגה בייט ב־FP8 שמאפשר עבודה רציפה על חומרה צרכנית של 16 גיגה בייט זיכרון.

איפה זה נופל

התמיכה הטבעית בשפות ובטקסט בתוך תמונות מוגבלת לאנגלית ולסינית בלבד, כך שאין מה לצפות לרינדור של מילים בעברית. בנוסף, מודלים שעברו זיקוק לשמונה צעדים נוטים להיות רגישים מאוד לבחירת המשקלים ומתקשים לפעמים בשינויים עדינים בסגנון ביחס למודל הבסיס המלא. הדף גם מציע שתי וריאציות של FP8, וחשוב לוודא שהכרטיס שלכם תומך בפורמט E4M3FN כדי לא להיתקל בשגיאות בזמן הטעינה.

שאלות
נפוצות

האם אפשר לייצר תמונות עם טקסט בעברית?

המודל מאומן לרנדר טקסט באנגלית ובסינית בלבד. אם תבקשו מילים בעברית תקבלו עיוותים או אותיות לא קשורות, ולכן לפרומפטים שדורשים כיתוב ישיר עדיף לכתוב באנגלית.

איזה כרטיס מסך נחוץ כדי להריץ את גרסת ה־FP8?

הקבצים שוקלים 11.5 גיגה בייט, כך שכרטיס עם 16 גיגה זיכרון וידאו כמו RTX 4080 יריץ אותו בקלות. כרטיסים שתומכים בחומרת FP8 ייהנו גם ממהירות ביצוע גבוהה במיוחד.

איך מריצים

המודל שוקל 11.5 גיגה בייט ומיועד לעבודה עם ספריית diffusers. הגרסה המקורית של המודל ב־BF16 דורשת כרטיס עם 16 גיגה זיכרון וידאו, כך שגרסת ה־FP8 הזו יושבת בנוחות על כרטיסים צרכניים מודרניים של 12 או 16 גיגה בייט בלי לחנוק את המערכת.

אם אתם צריכים רק תמונה אחת פעם ביום, אין סיבה להוריד עשרה גיגה בייט ולהגדיר סביבה מקומית, עדיף להשתמש בדמו הרשמי או לפנות לממשק חיצוני. ההרצה המקומית ב־FP8 שווה את המאמץ אם אתם בונים צינור עבודה פנימי ורוצים זמני תגובה מהירים בלי לשלם על כל קריאה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("drbaph/Z-Image-Turbo-FP8")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 11.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקלים, שילוב במוצרים קיימים והפצה חופשית, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗