GPT
L

lcm-lora-sdv1-5

קוד פתוח

latent-consistencyopenrail++2023-11-07

  • diffusers
  • lora
  • text-to-image

מתאם קל שמקצר את זמן היצירה של תמונות בסטייבל דיפיוז'ן לשניים עד שמונה צעדים בלבד. מתאים למי שחייב מהירות שיא ולא מוכן לשלם על מודלים ענקיים וכבדים.

  • 129 MBמשקל הקבצים
  • 87,720הורדות בחודש
  • 533לייקים

מה זה

המתאם הזה לא מייצר תמונות לבד, אלא מתלבש על סטייבל דיפיוז'ן 1.5 או מודלים שמבוססים עליו, כמו למשל דרים שייפר 7. הוא מביא את הגישה של מודלי עקביות ומאפשר לחתוך את כמות הצעדים מ־20 או 30 לכמות זעירה של בין שניים לשמונה צעדים, מה שמקצר משמעותית את זמן ההמתנה לכל פלט.

עם 67.5 מיליון פרמטרים בלבד ונפח של 129 מגה בייט, מדובר בגרסה הכי קלה בסדרה, במיוחד בהשוואה לגרסאות שנבנו עבור אס אס די של מיליארד פרמטרים או אס די אקס אל שמגיעה ל־197 מיליון פרמטרים. בנוסף ליצירת תמונה מטקסט, אפשר לשלב אותו במשימות של תמונה לתמונה, עריכה מקומית ושילוב עם קונטרול נט.

מתאים ל

  • תצוגה מקדימה מהירה

    מאפשר יצירת סקיצות ראשוניות כמעט בזמן אמת בגלל העבודה ב־2 עד 4 צעדים.

  • עריכת Inpainting זריזה

    מתלבש על מודל 1.5 לתיקון אזורים בתמונה בלי לעכב את המשתמש בעשרות צעדים.

  • יצירה עם ControlNet

    שומר על הנחיות מבניות מקונטרול נט תוך קיצור דרסטי של זמן הרינדור לכל פריים.

איפה זה נופל

חייבים להיזהר מאוד עם ערכי ההנחיה, guidance scale. אם תגדירו ערכים רגילים של 7 או 8 התמונה תיהרס, והכרטיס דורש במפורש לכבות את הפרמטר לגמרי או להגביל אותו לטווח שבין 1.0 ל־2.0 בלבד. בנוסף, מי שבוחר לרדת לשני צעדים בלבד צריך לצפות לפגיעה ברמת הפירוט לעומת שמונה צעדים, ומבחני הביצועים המדויקים עדיין לא פורסמו רשמית בתיעוד.

שאלות
נפוצות

האם המתאם הזה עובד לבד בלי מודל נוסף?

לא. מדובר במשקולות לורה שחייבים לטעון מעל מודל בסיס תואם כמו סטייבל דיפיוז'ן 1.5 או נגזרות שלו. הוא לא מסוגל לייצר תמונה מאפס בכוחות עצמו.

למה התוצאה יוצאת מטושטשת או שרופה לגמרי?

הסיבה הנפוצה ביותר היא השארת ערך ברירת המחדל של guidance scale מהמודל הרגיל. בכלי הזה חובה להגדיר את הערך על 0 או לשמור אותו בטווח שבין 1.0 ל־2.0, ולוודא שהחלפתם את המתזמן ל־LCMScheduler.

האם המודל הזה מתאים לעבודה עם SDXL?

לא, הקובץ הנוכחי מכיל 67.5 מיליון פרמטרים ומותאם ספציפית לארכיטקטורה של 1.5. עבור SDXL קיים מתאם נפרד מאותה משפחה ששוקל 197 מיליון פרמטרים.

איך מריצים

טוענים אותו מעל מודל בסיס תואם דרך ספריית diffusers בגרסה 0.23.0 ומעלה, יחד עם חבילות peft ואקסלרייט. חובה להחליף את המתזמן הרגיל במתזמן ייעודי מסוג LCMScheduler, ומומלץ להשתמש בפקודת המיזוג כדי לחבר את המשקולות ישירות לצינור העבודה.

בגלל המשקל הקטן והבסיס של 1.5, אפשר להריץ אותו בקלות על כרטיסי מסך ביתיים צנועים עם תמיכה ב־CUDA וללא צורך בשרתים מנופחים. מומלץ לפנות ל־API חיצוני רק אם אתם בונים שירות עם סקייל עצום שדורש ניהול תורים מורכב ואתם לא רוצים להחזיק תשתית ענן דולקת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("latent-consistency/lcm-lora-sdv1-5")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 129 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון openrail++ מתיר שימוש מסחרי ומאפשר להפיץ מוצרים שמבוססים עליו, אבל הוא כולל רשימת הגבלות אתיות על שימושים אסורים. אם אתם משלבים אותו באפליקציה או מעבירים את המשקולות הלאה, עליכם להצמיד את תנאי הרישיון ולאפשר למשתמשי הקצה גישה אליהם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗