GPT
S

stable-cascade

קוד פתוח

stabilityaiother2024-02-06

  • diffusers
  • safetensors
  • text-to-image

ארכיטקטורת יצירת תמונות שמבוססת על דחיסה חריגה של מרחב לטנטי. המטרה היא להוציא תמונות באיכות גבוהה בזמן הסקה קצר בהרבה ממודלי דיפוזיה רגילים.

  • 81.3 GBמשקל הקבצים
  • 10,526הורדות בחודש
  • 1,331לייקים

מה זה

במקום לעבוד עם דחיסה רגילה שמקטינה תמונה פי 8, החומרה כאן נשענת על ארכיטקטורת Würstchen שדוחסת תמונה פי 42. תמונה של 1024 על 1024 מצטמצמת לייצוג של 24 על 24 בלבד, שעליו המודל לומד ויוצר את המידע מטקסט. המבנה מחולק לשלושה שלבים נפרדים, כשרק שלב C מייצר את התוכן הראשוני, ושלבים B ו־A משחזרים ממנו את התמונה המלאה.

בבדיקות השוואה אנושיות מול SDXL ו־Playground v2, המודל הזה הוביל בהתאמה לטקסט ובאיכות אסתטית כשהוא רץ ב־30 צעדי הסקה בלבד. היכולת לרדת ל־24 על 24 מאפשרת לבצע אימונים וריצות במהירות גבוהה ובעלויות נמוכות יותר לעומת סדרת הדיפוזיה הרגילה, תוך שמירה על תמיכה בהרחבות כמו LoRA ו־ControlNet.

מתאים ל

  • מחקר על דחיסה גנרטיבית

    בדיקת יכולות למידה במרחב לטנטי דחוס פי 42 בהשוואה לשיטות הדיפוזיה המקובלות.

  • יצירת אמנות וקונספטים

    הפקת תמונות ורקעים שלא כוללים פנים או דמויות אנושיות שדורשות דיוק אנטומי גבוה.

  • בדיקת כלים חינוכיים

    התנסות בהרצת מודלי תמונה עם דרישות הסקה זולות יחסית עבור סביבות לימודיות.

איפה זה נופל

היוצרים מודים ישירות שהמודל מתקשה ביצירה נכונה של פנים ובבני אדם בכלל, כך שהוא יציג עיוותים באזורים האלה. בנוסף, שלב הקידוד והפענוח מאבד מידע מעצם הדחיסה הגבוהה, ולא מדובר בשחזור מושלם. הכלי גם לא אומן לייצג אנשים או אירועים באופן עובדתי, וחל איסור להשתמש בו למטרות אלה.

שאלות
נפוצות

האם אפשר להשתמש במודל ליצירת תמונות של אנשים לפרויקט?

עדיף שלא. הכרטיס מציין במפורש שהמודל מתקשה ביצירה נכונה של פנים ובני אדם, לצד העובדה שהוא מיועד למחקר בלבד.

איזה שילוב של משקלים כדאי לטעון בשביל האיכות הטובה ביותר?

היוצרים ממליצים לבחור בגרסת 3.6 מיליארד הפרמטרים של שלב C יחד עם גרסת 1.5 מיליארד של שלב B. השילוב הזה קיבל את מרבית הליטוש ומשחזר פרטים קטנים בצורה הטובה ביותר.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־81.3 גיגה-בייט, כך שמדובר בהורדה כבדה מאוד שדורשת שטח דיסק וכרטיס מסך רציני עם מספיק VRAM כדי להחזיק את שלבי המודל. להרצה משתמשים בספריית diffusers עם הצינור המשולב בפורמט bf16, מה שמחייב התקנה של PyTorch מגרסה 2.2.0 ומעלה. אם אתם תקועים על גרסאות ישנות יותר, תיאלצו להמיר את המשקלים ידנית ל־float16 ולהריץ את שלב הפענוח בנפרד.

יש שתי גרסאות לשלב C שכוללות מיליארד או 3.6 מיליארד פרמטרים, ושתי גרסאות לשלב B של 700 מיליון ו־1.5 מיליארד פרמטרים. אם אין לכם חומרה חזקה להחזיק את השילוב הגדול שנותן את הפרטים החדים ביותר, אפשר לרדת לגרסאות הקלות, אך התוצאות בירידה לפרטים קטנים יהיו פחות מדויקות בהתאם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/stable-cascade")
img = pipe("a photo").images[0]

הקבצים

55 קבצים במאגר, 81.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other והיוצרים מציינים במפורש שהמודל מיועד למטרות מחקר בלבד. אי אפשר לשלב אותו במוצר מסחרי כרגע, והשימוש כפוף למדיניות השימוש של Stability AI.

הרישיון המלא בעמוד המודל ↗