GPT
S

Segmind-Vega

קוד פתוח

segmindapache-2.02023-11-30

  • diffusers
  • safetensors
  • text-to-image
  • ultra-realistic
  • stable-diffusion

גרסה מזוקקת וקומפקטית של SDXL שמייצרת תמונות ברווזולוציית 1024 פיקסלים. היא נותנת מהירות כפולה וחיסכון משמעותי במשאבים מול מודל הבסיס.

  • 745Mפרמטרים
  • 12.3 GBמשקל הקבצים
  • 2,108הורדות בחודש
  • 132לייקים

מה זה

הצוות של Segmind לקח את SDXL והעביר אותו זיקוק ידע בעזרת מודלים כמו ZavyChromaXL ו־JuggernautXL, לצד נתונים מ־Grit וסריקות ממידג'רני. התוצאה היא מודל תמונה עם 745 מיליון פרמטרים בלבד, חיתוך של שבעים אחוז בגודל מול SDXL המקורי. הוא שומר על היכולת לעבוד ברזולוציה של 1024 על 1024, אבל רץ במהירות כפולה לפי בדיקות החברה.

במקום לסחוב ארכיטקטורה כבדה, מקבלים משקל קל שמאפשר יצירת תמונות מהירה. המדידות של המפתחים נערכו על מעבד A100 עם 80 גיגה זיכרון יחד עם tiny-VAE, ושם נרשם קיצור הזמנים המשמעותי. בשביל להוציא תוצאות טובות, המפתחים מדגישים שחייבים להשתמש בהנחיה שלילית ולהגדיר ערך של 9.0 ב־CFG.

מתאים ל

  • מחוללי תמונות בזמן אמת

    זמן יצירה מהיר פי שניים מ־SDXL שמתאים לממשקים שדורשים תגובה זריזה.

  • אימון מותאם בתקציב נמוך

    התאמת LoRA או Dreambooth למותג מסוים על גבי ארכיטקטורה קלה בהרבה מ־SDXL.

  • יצירת סקיצות וקונספט ארט

    הפקת רעיונות ויזואליים מהירים ב־1024 פיקסלים בלי להעמיס על כרטיסי המסך.

איפה זה נופל

היוצרים מודים בפירוש שהמודל מתקשה ביצירת פוטוריאליזם מוחלט, בעיקר כשמדובר בדמויות אנושיות. הוא נופל ברינדור של טקסט ברור בתוך התמונה, ומאבד דיוק כשמבקשים ממנו קומפוזיציות מורכבות מדי. הוא לחלוטין לא מתאים למשימות שדורשות דיוק עובדתי או הצגה מהימנה של אירועים ואנשים אמיתיים, ומוטה מהנתונים שעליהם הוא אומן.

שאלות
נפוצות

איך מוציאים מהמודל את התוצאות הטובות ביותר?

היוצרים מציינים במפורש שחובה להשתמש ב־negative prompt מפורט שמסנן איכות נמוכה. בנוסף, מומלץ לקבע את מדד ה־CFG באזור 9.0 כדי לקבל היצמדות טובה לטקסט.

האם המודל יודע לייצר טקסט קריא בתוך תמונות?

לא. כרטיס המודל מזהיר במפורש שיש לו קושי בשילוב טקסט ברור, וזו מגבלה מובנית שצריך לקחת בחשבון אם הגרפיקה שלכם כוללת אותיות ומילים.

איך מריצים

מריצים אותו דרך ספריית diffusers ב־Python בעזרת הצינור הרגיל של StableDiffusionXLPipeline, עם safetensors ובדיוק של fp16. למרות שהמשקל הכללי של הקבצים בהורדה מגיע ל־12.3 גיגה-בייט, 745 מיליון הפרמטרים דורשים פחות זיכרון עיבוד מ־SDXL סטנדרטי, וכרטיס מסך מודרני עם תמיכה ב־CUDA יספיק פה בקלות.

אם אין לכם חומרה ייעודית זמינה או שאתם לא רוצים לתחזק שרתים לתעבורה משתנה, Segmind מציעים גישה למודל דרך הפלטפורמה שלהם. מצד שני, מי שצריך לאמן LoRA או לבצע פיין-טיונינג יכול להריץ את הסקריפטים המוכנים שסופקו ישירות על הברזלים שלו.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("segmind/Segmind-Vega")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו במוצרים סגורים ולהפיץ הלאה. התנאים העיקריים דורשים שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗