GPT
S

sdxs-512-0.9

קוד פתוח

IDKiroopenrail++2024-03-25

  • diffusers
  • safetensors
  • text-to-image
  • stable-diffusion

מדובר במודל דיפוזיה מכווץ של 328 מיליון פרמטרים שמייצר תמונות בצעד ריצה בודד. הוא מתאים למי שחייב מהירות בזמן אמת ולא רוצה להחזיק תשתית כבדה ויקרה.

  • 328Mפרמטרים
  • 4.1 GBמשקל הקבצים
  • 969הורדות בחודש
  • 110לייקים

מה זה

המודל הזה לוקח את הרעיון של יצירת תמונה מטקסט ומוריד אותו לגודל זעיר ביחס למה שמקובל בתחום. הוא מבוסס על שילוב של SD Turbo כמורה וגרסת הבסיס של SD 2.1, תוך שימוש בזיקוק ידע והתאמת מאפיינים כדי לאפשר יצירה בצעד אחד בלבד בלי צורך בהנחיית סיווג.

בפועל, הוא משתמש במפענח TAESD כדי לחסוך עוד משאבים, ומחליף שכבות תשומת לב עצמית בתשומת לב צולבת ברזולוציות הגבוהות. המפתחים מבהירים שזו גרסה ישנה של הפיתוח שלהם, והיא נוצרה בין היתר כדי לעקוף סיכוני זכויות יוצרים ושימוש מסחרי שמנעו את שחרור גרסאות 1.0 המלאות.

מתאים ל

  • תצוגה מקדימה בזמן אמת

    יצירה בצעד אחד מאפשרת לקבל פידבק מיידי בזמן שהמשתמש מקליד פרומפט.

  • הרצה על חומרה מקומית חלשה

    משקל קטן של 328 מיליון פרמטרים שמתאים למחשבים ללא כרטיסי מסך יקרים.

  • בדיקות פיתוח מהירות

    מתאים לניסויים בצנרת עיבוד תמונה כשמחפשים מהירות תגובה ולא איכות שיא.

איפה זה נופל

הגרסה הזו סובלת מכמה פשרות טכניות ברורות שהיוצרים מציינים בעצמם. השימוש במפענח TAESD עלול לייצר תמונות באיכות נמוכה אם מריצים אותו ב־float16 במקום float32. בנוסף, חסר כאן כוונון עדין מבוסס LoRA-GAN שהיה אמור לשפר פרטים קטנים, ולכן התוצאות פחות מפורטות. המפענח הייעודי של הפרויקט בכלל לא נתמך כרגע בספרייה הרשמית.

שאלות
נפוצות

למה התמונות יוצאות מטושטשות או מעוותות?

אם הגדרתם דיוק של float16, מפענח ה־TAESD שבשימוש כאן נוטה לייצר פגמים באיכות. כדאי לעבור ל־float32 בקוד ההרצה כדי לייצב את התוצאה, או לעבור לגרסת DreamShaper החדשה יותר.

האם כדאי להשתמש במודל הזה למוצר חדש?

לא ממש. היוצרים עצמם מגדירים אותו כגרסה ישנה שחסרה שיפורי פרטים, ומפנים לגרסה עדכנית יותר של הפרויקט. שווה לבדוק אותו בעיקר למחקר או כבסיס להשוואה מול ארכיטקטורות קלות אחרות.

איך מריצים

ההרצה נעשית ישירות דרך ספריית diffusers עם פייפליין רגיל של Stable Diffusion. צריך להגדיר צעד ריצה בודד וערך guidance scale של אפס, אחרת המודל פשוט לא יעבוד נכון.

מבחינת חומרה, קובצי המשקל שוקלים כ־4.1 גיגה בייט, כך שכל כרטיס מסך מודרני פשוט עם מעט זיכרון יריץ אותו מקומית בלי מאמץ. אם אתם שוקלים להשתמש בו בסביבת ייצור, שימו לב שהמפתחים עצמם מפנים כבר לגרסה חדשה יותר בשם SDXS-512-DreamShaper שמציגה ביצועים ואיכות עדיפים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("IDKiro/sdxs-512-0.9")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא openrail++. הוא מאפשר שימוש מסחרי ומחקר, אבל מטיל מגבלות שימוש ספציפיות שאוסרות על יישומים פוגעניים, הפצת מידע כוזב או הפרות חוק. אם אתם משלבים את המשקלים בתוך מוצר, אתם מחויבים לכלול את תנאי הרישיון המקוריים ולהעביר את ההגבלות האלה הלאה למשתמשי הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗