GPT
L

LCM_Dreamshaper_v7

קוד פתוח

SimianLuomit2023-10-14

  • diffusers
  • onnx
  • safetensors
  • text-to-image
  • en

גרסה מזוקקת של מודל תמונה שמתמקדת ביצירה מהירה מאוד במספר צעדים בודד. היא מתאימה למי שחייב זמן תגובה מיידי ומוכן להתפשר על חדות הפרטים.

  • 860Mפרמטרים
  • 12.3 GBמשקל הקבצים
  • 128,476הורדות בחודש
  • 416לייקים

מה זה

במקום להריץ עשרות צעדי דגימה כמקובל במודלים מבוססי Stable Diffusion v1.5, המודל הזה אומן בשיטת זיכוך ישירות מעל Dreamshaper v7 כדי לייצר תוצאה סבירה בטווח של צעד אחד עד שמונה צעדים בלבד. תהליך האימון לקח כ־32 שעות על מעבד A100 וכלל 4,000 צעדים, תוך הטמעה מראש של ה־classifier-free guidance בתוך הקלט.

המשמעות בפועל היא צניחה דרמטית בזמן ההמתנה לכל תמונה. המפתחים מדדו ביצועים ברזולוציה של 768 על 768 עם קבוצות של ארבע תמונות על גבי מעבד A800, והמודל מייצר תמונות שלמות בחלקיק מהזמן שדורש מודל מקורי, בלי צורך בתהליך חישוב ארוך לכל פריים.

מתאים ל

  • תצוגה מקדימה בזמן אמת

    יצירת סקיצות ויזואליות תוך כדי הקלדה או ציור, בזכות היכולת להוציא פלט בתוך צעדים בודדים בלבד.

  • ייצור תמונות בעומס גבוה

    הפקת כמויות גדולות של תמונות במהירות בעלויות מחשוב נמוכות יותר, כשהמהירות קודמת לרמת פירוט מקסימלית.

  • שילוב במערכות אינטראקטיביות

    מתאים לממשקים שבהם המשתמש ממתין לתשובה מידית ואינו יכול לחכות עשרות שניות לכל תמונה.

איפה זה נופל

המעבר למספר צעדים נמוך פוגע ישירות בעומק הפרטים ובדיוק של התוצאה הסופית. היוצרים עצמם מציינים ששימוש ב־float16 לצורך חיסכון במשאבים עלול לפגוע עוד יותר באיכות התמונה, כך שהאיזון בין מהירות למראה נקי עדין מאוד.

בנוסף, המודל תומך רק בהנחיות באנגלית. ניסיון להזין טקסט בעברית לא יעבוד בצורה תקינה וידרוש תרגום מוקדם בצד השרת לפני הפנייה למודל.

שאלות
נפוצות

כמה צעדי ריצה צריך להגדיר בפועל?

היוצרים ממליצים על טווח של בין צעד אחד לשמונה צעדים, כאשר ארבעה צעדים הם נקודת ברירת המחדל. אין טעם להעלות מעבר לזה, כי המודל לא תוכנן לריצות ארוכות.

האם אפשר להריץ את המודל על כרטיס מסך ביתי?

כן, בתנאי שיש בו מספיק זיכרון להחזיק מודל של 860 מיליון פרמטרים. כדי לצמצם את צריכת הזיכרון אפשר להשתמש ב־float16, אך הדבר עשוי לפגוע באיכות התמונה המופקת.

איך מריצים

ההרצה נעשית דרך ספריית diffusers בגרסה 0.22 ומעלה, יחד עם transformers ו־accelerate. כברירת מחדל ההרצה מוגדרת על float32 ודורשת כרטיס מסך תומך CUDA, אך אפשר להעביר אותה ל־float16 כדי לחסוך בזיכרון, במחיר של ירידה מסוימת באיכות התמונה.

אם יש לכם כרטיס מסך ייעודי מקומי, שווה להריץ אותו ישירות כי המטרה המרכזית שלו היא ביצועים בזמן אמת. שירותי ענן חיצוניים מתאימים בעיקר אם אין לכם חומרה מתאימה להורדת 12.3 גיגה־בייט של קבצים ולהחזקת המודל בזיכרון ה־GPU.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("SimianLuo/LCM_Dreamshaper_v7")
img = pipe("a photo").images[0]

הרישיון

המודל שוחרר תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים, כשהדרישה היחידה היא שמירה על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗