GPT
S

sdxl-turbo

קוד פתוח

stabilityaiother2023-11-27

  • diffusers
  • onnx
  • safetensors
  • text-to-image

המודל מייצר תמונות מטקסט בצעד דגימה בודד ומיועד למי שחייב מהירות תגובה קיצונית. הוא חוסך זמן חישוב יקר על חשבון גודל התמונה ואיכות הפירוט.

  • 2.6Bפרמטרים
  • 51.7 GBמשקל הקבצים
  • 619,241הורדות בחודש
  • 2,626לייקים

מה זה

הפיתוח הזה מבוסס על זיקוק של מודל SDXL 1.0 בשיטה שנקראת Adversarial Diffusion Distillation. במקום לעבור עשרים או חמישים צעדי חישוב לכל פלט, השיטה הזו משלבת רשת מורה יחד עם לוס אדברסרי כדי לייצר תמונה שלמה בהרצה אחת בלבד של הרשת, או בעד ארבעה צעדים כשרוצים שיפור קל בתוצאה.

מבחני העדפה אנושיים שמופיעים בדוח מראים שמשתמשים העדיפו את התוצאות של המודל הזה בצעד בודד, גם באיכות התמונה וגם בהיצמדות להנחיה הטקסטואלית, על פני תוצאות של מודל LCM-XL בארבעה צעדים ומטה. בעבודה מולו לא משתמשים בכלל בהנחיות שליליות או במנגנון guidance scale, ומגדירים את הערך שלו כאפס. זה אומר פחות התעסקות בכוונון פרמטרים מסביב, אבל גם פחות מנופי שליטה עדינים על הקומפוזיציה הסופית.

מתאים ל

  • יישומי יצירה בזמן אמת

    היכולת לחשב פלט בצעד יחיד מתאימה לממשקים שמחייבים תגובה מיידית למשתמש.

  • עריכת תמונה לתמונה מהירה

    המודל מקבל תמונת מקור ומשנה אותה לפי טקסט בחישוב קצר עם פרמטר חוזק מוגדר.

  • מחקר על זיקוק דיפוזיה

    בדיקת שיטות אימון אדברסריות על מודלים גדולים בתחום הלמידה העמוקה.

איפה זה נופל

הרזולוציה המועדפת והטבעית של הפלטים היא 512 על 512 פיקסלים בלבד, ורכיב הקידוד האוטומטי מאבד מידע בתהליך. הכרטיס מודה בפירוש שהמודל לא מגיע לפוטו-ריאליזם מושלם, מתקשה לייצר פנים ואנשים בצורה אמינה, ולא מסוגל לעבד או להציג טקסט קריא. בנוסף, הוא לא נבנה כדי לייצג עובדות, אירועים או דמויות אמיתיות.

שאלות
נפוצות

האם אפשר להשתמש בהנחיות שליליות כדי לסנן פרטים?

לא. המודל פועל ללא מנגנון הנחיה מסורתי, ויש להגדיר את ערך ה־guidance scale לאפס. כל הניסוח חייב להיכנס לפרומפט החיובי בלבד.

באיזו רזולוציה כדאי לעבוד?

הוא עובד בצורה מיטבית ברזולוציה קבועה של 512 על 512 פיקסלים. רזולוציות גבוהות יותר ידרשו בדיקה ידנית של התוצאה או מודל נפרד להגדלה.

איך מריצים

אתם מריצים אותו דרך ספריית diffusers בפורמט חצי דיוק fp16 על גבי כרטיס מסך של אנבידיה עם תמיכת CUDA. כדי לקבל תוצאה תקינה מגדירים צעד ריצה אחד וערך guidance scale שווה לאפס, או משתמשים בתמונת מקור למשימות תמונה לתמונה תוך שמירה על מכפלת הצעדים בעוצמה של לפחות אחד.

המשקל הכולל של הקבצים במאגר מגיע ליותר מחמישים ג'יגה בייט על פני שלושים ותשעה קבצים, אם כי המשקל המעשי של המשקולות בזיכרון תואם למודל של 2.6 מיליארד פרמטרים. אם אין לכם שרת ייעודי עם מעבד גרפי מודרני בעל נפח זיכרון מספק, עדיף לפנות לנקודת קצה מנוהלת ברשת במקום לשאת בעלויות האחסון והרצת החומרה המקומית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/sdxl-turbo")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כמשטר עצמאי ולא פתוח לחלוטין. הוא מתיר שימוש חופשי לצורכי מחקר, לימוד ושימוש לא מסחרי לפי קובץ הרישיון במאגר. שימוש מסחרי בתוך מוצר דורש רכישת מנוי מסחרי נפרד ישירות מול חברת סטביליטי.

הרישיון המלא בעמוד המודל ↗