GPT
T

TCD-SDXL-LoRA

קוד פתוח

h1tmit2024-02-29

  • diffusers
  • lora
  • text-to-image

מתאם LoRA קל שמאיץ יצירת תמונות בבסיס SDXL למספר צעדים בודד. הוא שומר על חדות ואיכות גם כשמעלים את כמות הצעדים, בלי לקרוס כמו שיטות זיכוך מתחרות.

  • 448 MBמשקל הקבצים
  • 595הורדות בחודש
  • 116לייקים

מה זה

מדובר במודל זיכוך בשיטת Trajectory Consistency Distillation שיושב כתוספת LoRA מעל SDXL Base 1.0. המטרה שלו היא לאפשר דגימה מהירה מאוד במעט צעדים, תוך עקיפת הבעיות המוכרות של שיטות אחרות. בניגוד ל־LCM שמאבד איכות ככל שמגדילים את מספר הצעדים, הוא שומר על יציבות ואפילו עוקף באיכות את מודל המקור כשרצים במספר צעדים גבוה עם דוגם DPM-Solver++(2S).

הוא מציע שליטה ברמת הפירוט של התמונה בזמן היקש באמצעות היפר־פרמטר בודד בשם gamma, בלי צורך במשקלים נוספים. בנוסף, הוא פועל לצד רכיבים קיימים באקוסיסטם של SDXL כמו ControlNet לעומק וקצוות, IP-Adapter, מודלי קהילה כמו Animagine XL ומתאמי סגנון שונים.

מתאים ל

  • האצת שרתי תמונות

    חיתוך זמני השיהוי של SDXL במוצר קיים למספר צעדים בודד ללא צורך בהחלפת מודל הבסיס.

  • שילוב עם ControlNet

    יצירה מהירה של תמונות מונחות מבנה בעזרת מפות עומק או זיהוי קצוות מבלי לפגוע באיכות.

  • הפקת סגנונות מותאמים

    הרצה משולבת עם סגנונות LoRA קהילתיים על בסיס SDXL לטובת גיוון ויזואלי מהיר.

איפה זה נופל

המודל אינו רשת שלמה אלא משקולת LoRA, ולכן הוא מוגבל למגבלות הבסיסיות של מודל SDXL שעליו הוא מולבש. הכרטיס מדגיש השוואות מול שיטות מבוססות GAN ומציין הימנעות מבעיות כמו ארטיפקטים של פרצופים כפולים, אך עדיין צריך לבדוק ידנית את ההתנהגות של פרמטר ה־gamma כדי לוודא שהוא לא מייצר תוצאות לא רצויות בערכים קיצוניים.

שאלות
נפוצות

האם אפשר להשתמש בקובץ הזה לבדו בלי שום דבר נוסף?

לא. מדובר במתאם LoRA במשקל של 448 מגה בייט בלבד, והוא חייב להיטען יחד עם מודל הבסיס SDXL 1.0 כדי לתפקד.

איך הוא מתנהג בהשוואה ל־LCM או SDXL-Lightning?

היוצרים מציינים שהוא שומר על איכות גבוהה גם כשמגדילים את מספר הצעדים בניגוד ל־LCM שנחלש שם. בהשוואה ל־SDXL-Lightning הוא לא משתמש באימון אדברסרי, ולכן נמנע מעיוותי תמונה ומציג גיוון טוב יותר.

האם הוא תומך במודלים ייעודיים של הקהילה?

כן, כל עוד המודל מבוסס על הארכיטקטורה של SDXL. הוא נבדק בין היתר מול מודלים כמו Animagine XL ומתאמי סגנון שונים.

איך מריצים

הרצה מקומית מתבססת על ספריית diffusers יחד עם transformers, accelerate ו־peft מפייתון. הקבצים של המתאם עצמו שוקלים 448 מגה בייט, אבל הם לא רצים לבד. חייבים לטעון מתחתיהם את SDXL המלא, מה שדורש מעבד גרפי עם מספיק זיכרון וידאו להרצת מודל הבסיס.

אם התשתית שלכם כבר מחזיקה מודל SDXL בשרת, הוספת המתאם הזה פשוטה ואינה דורשת שינוי ארכיטקטורה. אם אין לכם חומרה ייעודית מתאימה, הרצה עצמית של SDXL תהיה כבדה מדי ועדיף להסתמך על נקודת קצה מנוהלת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("h1t/TCD-SDXL-LoRA")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא MIT. מותר להשתמש בו לצרכים מסחריים, לשלב אותו בתוך מוצרים סגורים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗