GPT
S

sdxl-flash

קוד פתוח

sd-communitycreativeml-openrail-m2024-05-19

  • diffusers
  • safetensors
  • stable-diffusion
  • sdxl
  • flash

גרסה מואצת של SDXL שמנסה לאזן בין מהירות סבירה לבין איכות תמונה. היא מכוונת למי שרוצה לחתוך זמני ריצה בלי לסבול מהמריחות של מודלים מהירים אחרים.

  • 2.6Bפרמטרים
  • 13.1 GBמשקל הקבצים
  • 134הורדות בחודש
  • 201לייקים

מה זה

מדובר במודל טקסט לתמונה שמבוסס על ארכיטקטורת SDXL עם 2.6 מיליארד פרמטרים, שפותח בשיתוף עם Project Fluently. המפתחים שלו מצהירים ישירות שהם לא ניסו לשבור שיאי מהירות כמו שעושים בשיטות של LCM, Turbo, Lightning או Hyper, אלא חיפשו פשרה מציאותית יותר. ההנחה כאן היא שדחיסה אגרסיבית מדי מרסקת את הפירוט, ולכן הם מכוונים לטווח עבודה שדורש בין 6 ל־9 צעדים בלבד.

התוצאה היא משקל קבצים מלא של 13.1 גיגה בייט, בדיוק כמו המודל המקורי, אבל עם צורך בהרבה פחות שלבי דגימה כדי להגיע לפלט סביר. זה אומר שזמן היצירה פר תמונה יורד משמעותית בהשוואה לעשרות הצעדים של SDXL רגיל, בלי לעבור לגרסאות מזוקקות שמאבדות חדות.

מתאים ל

  • שרתי יצירה בעומס בינוני

    צמצום זמן היצירה ל־7 צעדים חוסך שעות GPU בשרתים שמשרתים משתמשי קצה.

  • בדיקת פרומפטים מקומית

    קבלת תוצאה מהירה מספיק בעבודה מקומית על כרטיס מסך ביתי בלי לחכות לעשרות צעדים.

  • תמונות לרשת באיכות גבוהה

    יצירת ארט וגרפיקה כשיש צורך ברזולוציה ודיוק של SDXL אבל התקציב למחשוב מוגבל.

איפה זה נופל

המודל מודה בעצמו שהוא איטי יותר מפתרונות מקבילים כמו Lightning או Turbo, כך שמי שמחפש יצירה בזמן אמת של עשרות מילישניות יתאכזב. מעבר לזה, טווח ההגדרות שלו צר מאוד. הוא דורש ערכי CFG נמוכים וספציפיים וסאמפלר מסוים מאוד כדי לעבוד טוב. אם תסטו מהטווח של 6 עד 9 צעדים או תשתמשו בערכי הנחיה רגילים של SDXL, איכות התמונה תרד מיד.

שאלות
נפוצות

למה להעדיף אותו על פני SDXL Turbo או Lightning?

המפתחים טוענים שהמודלים המהירים יותר משלמים מחיר כבד מדי באיכות ובפירוט של התמונה. כאן מקריבים מעט מהמהירות הקיצונית שלהם, ועובדים ב־6 עד 9 צעדים במקום 1 עד 4, במטרה לשמור על מראה נקי יותר.

האם הוא תופס פחות מקום בזיכרון מאשר SDXL רגיל?

לא. משקל הקבצים עומד על 13.1 גיגה בייט ומספר הפרמטרים נשאר 2.6 מיליארד. החיסכון הוא בזמן העיבוד של ה־GPU פר תמונה בזכות מספר הצעדים הקטן, ולא בנפח ה־VRAM שנדרש כדי לטעון אותו.

איך מריצים

טוענים אותו ישירות דרך diffusers בפייתון עם פייפליין סטנדרטי של StableDiffusionXL בפורמט float16, כשהסוד כאן הוא הגדרת ה־scheduler ל־DPMSolverSinglestepScheduler עם פרמטר timestep_spacing שמוגדר ל־trailing. מריצים עם CFG scale נמוך מאוד של 2.5 עד 3.5, ובין 6 ל־9 צעדים. הסאמפלר המומלץ לפי הכרטיס הוא DPM++ SDE.

בגלל המשקל, תצטרכו כרטיס מסך עם לפחות 12 עד 16 גיגה זיכרון כדי להחזיק אותו בנוחות לוקאלית. אם אין לכם חומרה כזו זמינה באופן קבוע, כנראה יהיה זול ופשוט יותר להרים שרת מנוהל בענן או להשתמש ב־API קיים במקום להחזיק GPU מקומי דולק.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("sd-community/sdxl-flash")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא creativeml-openrail-m. הוא מתיר שימוש מסחרי ומאפשר להטמיע את המודל במוצרים, אבל מטיל שורה של הגבלות שימוש אסורות סביב תוכן פוגעני, רפואי או מטעה. בנוסף, אם אתם מפיצים את המודל או נגזרות שלו, אתם מחויבים לצרף את תנאי הרישיון המקוריים ולחייב את המשתמשים באותן הגבלות.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗