GPT
L

lcm-lora-sdxl

קוד פתוח

latent-consistencyopenrail++2023-11-09

  • diffusers
  • lora
  • text-to-image

מתאם שמאיץ את יצירת התמונות בבסיס של SDXL לטווח של בין שניים לשמונה צעדים בלבד. מתאים למי שחייב מהירות תגובה גבוהה ביצירת תמונה בלי להחליף את כל התשתית הקיימת.

  • 377 MBמשקל הקבצים
  • 57,566הורדות בחודש
  • 774לייקים

מה זה

מדובר במתאם מסוג LoRA שמיועד למודל הבסיס SDXL 1.0 וכולל 197 מיליון פרמטרים. במקום להריץ עשרות צעדי דגימה כדי לקבל תמונה נקייה, המתאם מאפשר למודל לייצר תמונה בכמות צעדים נמוכה של בין 2 ל־8 צעדים בלבד. הוא עובד יחד עם מתזמן ייעודי מסוג LCMScheduler.

ההבדל העיקרי מול שימוש רגיל ב־SDXL הוא היכולת לשלב את המתאם הזה מעל מתאמי סגנון אחרים בלי לאמן מודל שלם מחדש. המשקל שלו עומד על 377 מגה בייט בארבעה קבצים, כך שתוספת שטח האחסון והטעינה שלו זניחה לחלוטין בהשוואה למודל הבסיס עצמו.

מתאים ל

  • מחולל תמונות אינטראקטיבי

    יצירת תמונות מהירה ב־2 עד 4 צעדים, מתאים לממשקים שדורשים פידבק כמעט מיידי מהמשתמש.

  • עריכת תמונות עם Inpainting

    מילוי ותיקון אזורים בתמונה קיימת בתוך שניות ספורות בלי להמתין לעשרות צעדי דיפוזיה.

  • שילוב סגנונות מותאמים

    הפעלת מתאמי סגנון של SDXL במהירות גבוהה על ידי מיזוג שני מתאמים במקביל.

איפה זה נופל

המתאם דורש שינוי מהותי בהגדרות הריצה הרגילות. חייבים להוריד את guidance_scale לערכים שבין 0 ל־2, אחרת התמונה נהרסת לגמרי. בנוסף, בריצה עם כלים כמו ControlNet הכרטיס מודה שפרמטרי ברירת המחדל לא בהכרח יעבדו וצריך לכוונן ידנית ערכים שונים כדי לא לקבל תוצאות מטושטשות או מעוותות. אין נתוני ביצועים רשמיים בכרטיס המודל, כך שחובה למדוד את מהירות הריצה בפועל אצלכם.

שאלות
נפוצות

האם המודל הזה עובד לבד?

לא. מדובר במתאם LoRA ששוקל 377 מגה בייט ודורש טעינה של מודל הבסיס המלא stable-diffusion-xl-base-1.0 כדי לפעול.

איך משתמשים בו עם מתאמי LoRA אחרים?

טוענים את שני המתאמים לתוך אותו pipeline באמצעות diffusers ומשתמשים בפונקציה set_adapters עם משקולות מתאימות, למשל 1.0 עבור LCM וערך נמוך יותר לסגנון.

איך מריצים

טוענים אותו ישירות דרך ספריית diffusers מעל מודל הבסיס stable-diffusion-xl-base-1.0 עם הגדרות fp16 על גבי מעבד גרפי של אנבידיה עם CUDA. חובה להגדיר את המתזמן ל־LCMScheduler, לטעון את המשקולות עם load_lora_weights, ולמזג אותן או לשלב לצד מתאמים נוספים בעזרת peft.

החומרה הנדרשת מוכתבת כולה ממודל הבסיס SDXL ולא מהמתאם הקטן. צריך מאיץ גרפי חזק שמחזיק SDXL בזיכרון. אם אין לכם שרת עם מאיץ גרפי מתאים, עדיף להשתמש ב־API חיצוני שכבר מחזיק את המודל בזיכרון במקום לשלם על שרת ייעודי רק בשביל להחזיק משקולות כבדות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("latent-consistency/lcm-lora-sdxl")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 377 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון openrail++. הרישיון מאפשר שימוש מסחרי, אבל כולל הגבלות שימוש ספציפיות על תחומים מזיקים מסוימים שחובה לציית להן כשמפיצים מוצר ללקוחות.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗