GPT
S

SSD-1B

קוד פתוח

segmindapache-2.02023-10-19

  • diffusers
  • safetensors
  • text-to-image
  • ultra-realistic
  • stable-diffusion

גרסה מזוקקת של סטייבל דיפיוז'ן אקס-אל ששוקלת חצי ומייצרת תמונות מהר יותר. מתאימה למי שרוצה איכות קרובה למקור בלי להחזיק כרטיס מסך ענק.

  • 1.3Bפרמטרים
  • 25.0 GBמשקל הקבצים
  • 12,360הורדות בחודש
  • 841לייקים

מה זה

המודל הזה לוקח את הבסיס של SDXL ומקצץ ממנו שכבות בתהליך זיקוק ידע. במקום לאמן מודל מאפס, היזמים לקחו מודלים קיימים כמו SDXL, ZavyChromaXL ו־JuggernautXL, והעבירו את היכולות שלהם למבנה קטן יותר עם 1.3 מיליארד פרמטרים. התוצאה היא משקל קל משמעותית ומהירות עבודה גבוהה בשישים אחוז לעומת מודל הבסיס.

האימון נעשה ברזולוציה של 1024 על 1024, עם תמיכה ביחסי תמונה מגוונים, כולל פורמטים רחבים או אנכיים קיצוניים כמו 1536 על 640. המטרה כאן היא לתת תגובה מהירה ביצירת תמונות מטקסט בלי לאבד את הגמישות הוויזואלית שהכרנו בגרסאות הגדולות.

מתאים ל

  • ייצור תמונות בזמן אמת

    זמן תגובה קצר בשישים אחוז מול המקור מאפשר שילוב בממשקים אינטראקטיביים.

  • אימון מודלי LoRA זולים

    ארכיטקטורה קלה שמתאימה לפיין טיונינג מהיר על חומרה ביתית בלי שרתים כבדים.

  • יצירת סקיצות ואמנות קונספט

    הפקה מהירה של רעיונות ויזואליים ועיצובים כלליים לפי טקסט ברזולוציות מגוונות.

איפה זה נופל

הקיצוץ בשכבות גובה מחיר ברור. המודל מתקשה בריאליזם מוחלט, בעיקר ביצירת דמויות אנושיות, תווי פנים ואנטומיה מורכבת. הוא לא מסוגל לשלב טקסט קריא בתוך תמונות, ונוטה לאבד פרטים בסצנות עמוסות בגלל המבנה של האוטו-אנקודר. אם אתם בונים על דיוק עובדתי, שחזור של אנשים אמיתיים או ייצוג גרפי מדויק של אותיות, הוא פשוט לא יעשה את העבודה.

שאלות
נפוצות

האם הוא נותן אותה איכות בדיוק כמו SDXL המקורי?

לא. החיתוך בשכבות מביא לפגיעה בפרטים קטנים, ברינדור של בני אדם ובקומפוזיציות עמוסות. הוא כן שומר על הסגנון הכללי ועל הרזולוציה, אבל התוצאה פחות פוטו-ריאליסטית.

איך מקבלים ממנו את התוצאה הכי טובה?

הכרטיס מדגיש שחובה להשתמש בפרומפט שלילי ולהגדיר ערך CFG סביב 9.0. בלי זה התמונות נוטות לצאת מטושטשות או עם עיוותים ברורים.

איך מריצים

טוענים אותו ישירות דרך ספריית diffusers באמצעות הצינור הרגיל של SDXL, בפורמט fp16 עם safetensors. יש גם קובץ ייעודי לממשק AUTOMATIC1111 ול־ComfyUI. כדי לקבל תוצאות סבירות, המפתחים ממליצים לעבוד עם CFG סביב 9.0 ולהזין פרומפט שלילי שמסנן מריחות וחוסר איכות.

הוא רץ מצוין על כרטיסי מסך ביתיים חזקים כמו RTX 4090 או כרטיסי שרת דוגמת A100. אם אתם צריכים ייצור תמונות פשוט בלי לתחזק שרת מקומי, אפשר לצרוך אותו ישירות דרך הפלטפורמה של Segmind, אבל המשקל הקומפקטי שלו הופך הרצה עצמית למהלך הגיוני מאוד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("segmind/SSD-1B")
img = pipe("a photo").images[0]

הרישיון

רישיון apache-2.0 פתוח ומתירני. מותר להשתמש בו בחינם לפרויקטים מסחריים ופרטיים, לשנות אותו, להפיץ אותו מחדש ולאמן עליו גרסאות משלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗