GPT
D

DMD2

קוד פתוח

tianweiycc-by-nc-4.02024-05-23

  • diffusers
  • text-to-image
  • stable-diffusion
  • diffusion distillation

הפרויקט הזה מביא זיקוק מהיר לדיפוזיה שמאפשר לייצר תמונות בצעד אחד או בארבעה צעדים בלבד. הוא מיועד למי שרוצה לקצר זמני ריצה של מודלי תמונה בלי לחכות לעשרות צעדי דגימה.

  • 285 GBמשקל הקבצים
  • 19,566הורדות בחודש
  • 246לייקים

מה זה

המאגר מרכז מימושים של שיטת זיקוק בשם Distribution Matching Distillation בגרסתה המשופרת, שנועדה לחתוך דרסטית את כמות צעדי החישוב ביצירת תמונות מטקסט. במקום להריץ עשרות צעדים כמקובל במודלים כמו SDXL, השיטה מאפשרת יצירת פלט בארבעה צעדים או אפילו בצעד בודד אחד.

בפועל המאגר כולל משקלים שונים שמתלבשים על מודל הבסיס SDXL 1.0, כולל מתאמי LoRA, משקלי UNet מלאים וגרסאות מותאמות למתאמי T2I. הרעיון הוא לשמר את היכולות הוויזואליות תוך שימוש במתזמן ייעודי מסוג LCMScheduler עם הגדרת צעדי זמן קבועים מראש.

מתאים ל

  • יצירת תמונות בזמן אמת

    מתאים למחקר שבוחן תגובה מהירה במיוחד של SDXL תחת מגבלת חומרה של צעד יחיד.

  • הטמעה קלה דרך LoRA

    מאפשר לשלב משקלי זיקוק מהירים מעל מודל SDXL קיים בלי להחליף את כל ה־UNet.

  • בדיקות ביצועי זיקוק

    כלי מצוין לחוקרים שרוצים להשוות תוצאות דגימה מהירות מול שיטות מקבילות כמו LCM.

איפה זה נופל

המאגר עצמו עצום ומחזיק 285 גיגה בייט הפרוסים על פני 118 קבצים, מה שאומר שאסור להוריד אותו במלואו אלא למשוך רק את הקובץ הבודד שאתם צריכים. שימוש בצעד אחד או ארבעה צעדים כופה guidance scale אפס וזמני דגימה קשיחים, מה שמגביל מאוד את הגמישות בפרמטרים. בנוסף, מודלים שזוקקו לצעד בודד נוטים לאבד פירוט מדויק או לסבול מעיוותים מול הנחיות טקסט מורכבות.

שאלות
נפוצות

האם צריך להוריד את כל 285 הגיגה כדי שהמודל יעבוד?

ממש לא, ואל תנסו לעשות את זה. המאגר מכיל עשרות גרסאות וחלופות של משקלים, ובפועל מורידים דרך הקוד רק קובץ ספציפי אחד, כמו משקל LoRA או קובץ UNet שמתאים למספר הצעדים שבחרתם.

אפשר להשתמש במודל הזה בתוך אפליקציה בתשלום?

לא, הרישיון הוא CC-BY-NC-4.0 ואינו מתיר שימוש מסחרי מכל סוג. הוא מיועד לשימוש אקדמי, מחקרי או לניסויים אישיים בלבד.

איך מריצים

ההרצה נעשית באמצעות ספריית diffusers בחיבור ישיר למודל הבסיס של SDXL. תצטרכו כרטיס מסך של אנבידיה עם תמיכה בחישובי fp16 ומספיק זיכרון וידאו להרצת SDXL, בדרך כלל לפחות 12 עד 16 גיגה בייט כדי לטעון את המודל והמתאמים בלי להיחנק.

בקוד מגדירים את הצינור הרגיל של SDXL, טוענים קובץ ספציפי מתוך המאגר כמו משקלי LoRA או קובץ ה־UNet של הצעד הבודד, ומגדירים guidance scale על אפס עם זמני צעד מותאמים אישית. אין פה שירות ענן מובנה או ממשק מוכן, כך שאם אין לכם שרת עם מאיץ גרפי מתאים, תצטרכו לשכור מכונה ייעודית בענן כדי להריץ את הקוד בעצמכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("tianweiy/DMD2")
img = pipe("a photo").images[0]

הקבצים

118 קבצים במאגר, 285 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון שהוגדר הוא Creative Commons לא מסחרי, CC-BY-NC-4.0. זה אומר שמותר להוריד, לשנות ולבדוק את המודל לצרכי מחקר וניסויים אישיים בלבד, תוך מתן קרדיט ליוצרים. אסור בשום אופן לשלב את המשקלים האלה במוצר מסחרי, למכור גישה אליהם או לייצר מהם הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗