GPT
S

sd-turbo

קוד פתוח

stabilityaiרישיון לא דווח2023-11-27

  • diffusers
  • safetensors
  • text-to-image

הפקת תמונות מטקסט בצעד דגימה בודד בלבד. מתאים למי שחייב מהירות תגובה קיצונית בזמן אמת ומוכן להתפשר על איכות התוצאה.

  • 866Mפרמטרים
  • 12.1 GBמשקל הקבצים
  • 351,681הורדות בחודש
  • 460לייקים

מה זה

מדובר בגרסה מזוקקת של Stable Diffusion 2.1 שמיועדת ליצירת תמונות מהירה במיוחד. השיטה שעליה הוא בנוי משלבת ידע ממודלי דיפוזיה גדולים יחד עם אימון אדברסרי, מה שמאפשר לו לייצר פלט סביר בין צעד בודד לארבעה צעדים, במקום עשרות הצעדים שדרושים בדרך כלל.

במבחני העדפה אנושית שנערכו בצעד דגימה אחד, בודקים העדיפו את התוצאות שלו על פני מודלים מתחרים כמו LCM-Lora 1.5 ו־LCM-Lora XL, הן מבחינת איכות התמונה והן בהיצמדות להוראות הטקסט. עם זאת, היוצרים עצמם מציינים שהגרסה הגדולה יותר, SDXL-Turbo, מציגה איכות גבוהה יותר והבנת הנחיות טובה יותר.

מתאים ל

  • מחקר על דיפוזיה בזמן אמת

    מאפשר לבחון התנהגות של מודלים מזוקקים שעובדים בצעד יחיד.

  • יישומי יצירה אינטראקטיביים

    מתאים לכלים חינוכיים או אמנותיים שדורשים תגובה מיידית לקלט.

  • עיבוד תמונה לתמונה

    מבצע שינויים מהירים על בסיס תמונה קיימת בצעדים ספורים.

איפה זה נופל

התמונות מיוצרות ברזולוציה קבועה של 512 על 512 פיקסלים בלבד, ורכיב הקידוד שלו מאבד מידע בתהליך. הוא לא יודע לייצר טקסט קריא בכלל, ולעיתים קרובות מתקשה ביצירת פרצופים ואנשים. בנוסף, הוא אינו מתאים לייצוג עובדתי של אנשים או אירועים, ורמת הפוטו-ריאליזם שלו מוגבלת מאוד בהשוואה למודלים מלאים.

שאלות
נפוצות

האם אפשר להשתמש ב־negative prompt כדי לשפר את התוצאה?

לא, המודל פועל בצורה תקינה רק כאשר ה־guidance scale מוגדר על אפס. כתוצאה מכך, אין למנגנון ההנחיות השליליות שום השפעה על הפלט.

האם הוא מתאים לייצור תמונות באיכות הדפסה גבוהה?

ממש לא. הרזולוציה המומלצת שלו היא 512 על 512 פיקסלים, רמת הפירוט מוגבלת, והקידוד מאבד פרטים עדינים בתהליך.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך עם תמיכה ב־CUDA וספריית diffusers של פייתון. המודל שוקל 12.1 גיגה-בייט שמחולקים ל־22 קבצים, אבל בעבודה ב־fp16 מדובר בכ־866 מיליון פרמטרים, כך שחומרה סטנדרטית עם נפח זיכרון גרפי בסיסי תחזיק אותו בלי קושי.

בזמן ההרצה מבטלים לגמרי את מנגנון ה־guidance ומגדירים אותו על אפס, כך שאין שימוש בהנחיות שליליות. אם מטרת הפרויקט היא רק בדיקה מהירה של רעיון בלי לנהל תשתית, עדיף להשתמש בדמו או שירות קיים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/sd-turbo")
img = pipe("a photo").images[0]

הרישיון

בעמוד המודל לא דווח רישיון מוגדר, אך הטקסט מפנה לרישוי ולחברות באתר של Stability AI לצורך שימוש מסחרי. כל עוד לא בדקתם והסדרתם את התנאים ישירות מולם, אסור להניח שאפשר לשלב אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗