GPT
S

small-stable-diffusion-v0

קוד פתוח

OFA-Sysopenrail2023-01-16

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image
  • en

גרסה מכווצת של מודל יצירת תמונות מטקסט, שנועדה לחתוך בחצי את גודל המודל המקורי. היא מתאימה למי שחייב לייצר תמונות מהר על מעבדים או כרטיסים גרפיים פשוטים.

  • 4.1 GBמשקל הקבצים
  • 2,336הורדות בחודש
  • 104לייקים

מה זה

מדובר במודל שנוצר כדי לפתור את צוואר הבקבוק של משאבים ביצירת תמונות. המפתחים לקחו את הארכיטקטורה המקורית, צמצמו את השכבות בבלוקים של רשת ה־Unet לערך של שכבה בודדת, ואימנו אותה בתהליך זיקוק ידע מול מודלי המקור במיליון ומאה אלף צעדים.

התוצאה היא משקל קבצים כולל של 4.1 גיגה בייט וגודל כמעט חצי מהמקור. לפי נתוני המפתחים, שילוב של המודל עם ספריות אופטימיזציה ייעודיות מאפשר להגיע לזמן ריצה של חמש שניות לתמונה על מעבד אינטל מסוג קסאון בעשרה צעדים בלבד. זה הופך יצירת תמונות מסבירה לאפשרית גם בלי כרטיסי מסך יקרים, אם כי על מעבדי AMD ברירת המחדל לוקחת כשלושים וחמש שניות לחמישה עשר צעדים.

מתאים ל

  • שרתי אינטל ללא כרטיס מסך

    יצירת תמונות בחמש שניות על מעבד Xeon ייעודי בעזרת כלי פריסה מותאמים, בלי להחזיק כרטיס מסך יקר.

  • סקיצות ראשוניות לאפליקציות

    הפקת רעיונות ואמנות כללית במהירות, במקרים שבהם לא נדרשים ריאליזם מדויק או טקסט קריא.

  • מחקר על דחיסת מודלים

    בדיקת התנהגות מודלי דיפוזיה שעברו זיקוק ידע וצמצום שכבות Unet מול מודלים מלאים.

איפה זה נופל

המודל חולק את המגבלות של סביבת האימון המקורית, שכוללת דאטה מ־LAION בלי ניקוי כפילויות, ולכן יש סכנה של שינון תמונות. הוא לא מצליח לרנדר טקסט קריא בכלל, מתקשה מאוד ביצירת פנים ואנשים, ונכשל במשימות קומפוזיציה מורכבות כמו מיקום של חפץ ספציפי מעל חפץ אחר. מעבר לזה, המודל אומן בעיקר על תיאורים באנגלית. הוא לא מבין עברית כמו שצריך, והאיכות ברינדור ללא פרומפטים מדויקים באנגלית יורדת מיד.

שאלות
נפוצות

האם המודל תומך בהנחיות בעברית?

הוא אומן על מאגרי תמונות עם תיאורים באנגלית בלבד. אם תכתבו פרומפט בעברית תקבלו תוצאות מרוחות, לא קשורות או חוסר הבנה מוחלט של הבקשה.

האם המודל דורש כרטיס גרפי של אנבידיה כדי לעבוד מהר?

לא חובה, וזה בדיוק היתרון שלו. הוא מתוכנן לעבוד גם על מעבדי אינטל רגילים באמצעות ספריות מתאימות, ומייצר תמונה בכמה שניות בודדות על חומרה מתאימה.

האם יש צורך במנגנון סינון תוכן נוסף?

המפתחים מציינים שהמודל אומן על מידע המכיל גם תכנים למבוגרים. כדי לשלב אותו במוצר מומלץ להפעיל את מנגנון בדיקת הבטיחות שמגיע עם הספרייה כדי לחסום תוכן בעייתי.

איך מריצים

בפועל מריצים אותו דרך ספריית diffusers בגרסה 0.8.0 ומעלה, בשילוב פייטורץ' עם הגדרת float16 כדי לחסוך זיכרון עבודה. הקריאה בקוד פשוטה וטוענת ישירות את צינור העבודה המוכר של יצירת תמונות.

אם יש לכם כרטיס גרפי תומך קודה אפשר להריץ עליו מיד, אבל היתרון הגדול כאן הוא היכולת להמיר אותו באמצעות OpenVINO לריצה על מעבדי אינטל או TensorRT לכרטיסי מסך. אם אין לכם שרת עם מעבד אינטל חזק ואין לכם כרטיס מסך פנוי, עדיף להשתמש בממשק מרוחק או שירות ענן חיצוני במקום לתקוע את המחשב המקומי בחצי דקה של חישוב לכל פריים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("OFA-Sys/small-stable-diffusion-v0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא openrail, המאפשר שימוש במודל ובפלט שלו אבל כפוף להגבלות שימוש מחמירות. נאסר להשתמש בו להפצת תוכן פוגעני, מידע כוזב, תוכן מיני ללא הסכמה, פגיעה בזכויות יוצרים או יצירת ייצוגים משפילים של בני אדם. לשימוש מסחרי רגיל במוצר זה אפשרי, בתנאי שמוודאים עמידה בכללי השימוש האחראי הללו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗