GPT
M

mixture-of-diffusers

רץ בדפדפן

albarjiרישיון לא דווח2023-02-15

  • gradio

מייצרים תמונה פנורמית רחבה שמחברת שלושה תיאורי טקסט שונים לחלקי התמונה. הכלי מתאים למי שרוצה לשלוט במיקום של אלמנטים שונים בנוף אחד.

  • הורדות בחודש
  • 126לייקים

מה זה

אתם מגדירים שלושה אזורים נפרדים בתוך תמונה אחת: שמאל, מרכז וימין. עבור כל אזור מכניסים תיאור טקסטואלי משלו ובוררים את עוצמת ההצמדות לטקסט מתוך סליידר שנע בין 0 ל־15. בנוסף יש שליטה על פרמטרים כלליים שמשפיעים על התוצאה כולה, כולל כמות צעדי הדיפוזיה בין 1 ל־50, מספר סיד קבוע לשחזור תוצאות, ורוחב החפיפה בין האזורים השונים מ־128 עד 320 פיקסלים כדי שהחיבור ביניהם ייראה טבעי ולא חתוך.

מאחורי הקלעים הקוד טוען את המודל הבסיסי של Stable Diffusion בגרסה 1.4, בשילוב מתזמן בשם LMSDiscreteScheduler וצינור עבודה ייעודי שנקרא StableDiffusionCanvasPipeline מספריית mixdiff. הרעיון הוא לתת לכמה תהליכי דיפוזיה לרוץ במקביל על קנבס רחב ולמזג ביניהם באזורי החפיפה, במקום לנסות לדחוס את כל התיאורים לפרומפט אחיד אחד שמבלבל את המודל.

מתאים ל

  • יצירת נוף פנורמי רחב

    מגדירים תיאור נפרד לקצוות ולמרכז ומייצרים תמונה רחבה אחת עם שילוב ביניהם.

  • שליטה בהרכב סצנה מורכבת

    ממקמים עצמים ספציפיים בצדדים שונים בלי שהם יתערבבו זה בזה בטעות.

  • בדיקת מיזוג דיפוזיה

    בוחנים איך חפיפות שונות בין 128 ל־320 פיקסלים משפיעות על החיבור בין מודלים.

איפה זה נופל

הבעיה המיידית היא שהאפליקציה פשוט קרסה ומדווחת על שגיאת ריצה, ולכן אי אפשר להריץ בה שום דבר ישירות בדפדפן. בנוסף, המודל מתחת הוא גרסה 1.4 הישנה יחסית, כך שאיכות הפירוט מוגבלת בהשוואה למודלים מודרניים. החיבור בין האזורים נשען רק על חפיפה וסליידרים ידניים, מה שיכול לייצר מריחות מוזרות או כפילויות אם לא מכוונים את הערכים במדויק.

שאלות
נפוצות

האם האפליקציה עובדת עכשיו?

לא. המערכת מדווחת כרגע על שגיאת ריצה בעמוד, כך שלחיצה על כפתור הייצור לא תניב תמונה עד שהמפתח יעדכן את הקוד.

כמה זה עולה?

השימוש בממשק בדפדפן היה פתוח בחינם על גבי שרתי חישוב של האגינג פייס. אין פה מסלולי תשלום או מנויים.

האם אפשר להריץ את זה מקומית?

כן, אם מורידים את הקוד מ־app.py ומתקינים את ספריית mixdiff יחד עם התלויות של פייטורץ' ומודל SD 1.4. תצטרכו כרטיס מסך מתאים עם תמיכה ב־CUDA כדי שהקוד ירוץ במהירות סבירה.

במה זה שונה משימוש רגיל בסטייבל דיפיוז'ן?

במקום לתת פרומפט יחיד לכל התמונה, הקוד מחלק את הקנבס לשלושה חלקים ומריץ את המודל במקביל על כל חלק. המנגנון ממזג את האזורים בחפיפה מוגדרת מראש כדי לחבר ביניהם.

איך משתמשים

בממשק הנוכחי אין מה ללחוץ כרגע, כי היישום מוגדר במצב של שגיאת ריצה. כשהוא כן עבד, הזנתם שלושה פרומפטים, כיוונתם את החפיפה והצעדים, ולחצתם על כפתור הייצור כדי לקבל תמונה אחת. החומרה שהוקצתה לפרויקט היא מעבד גרפי T4 בענן, כך שעיבוד של 15 צעדים היה אמור לקחת שניות בודדות ולא דקות ארוכות.

הרישיון

הפרויקט לא כולל דיווח על רישיון שימוש בקוד שלו. בלי רישיון מוגדר, אין לכם אישור ברור לשימוש מסחרי בקוד או ביצירות, והאחריות כולה עליכם במקרה שתרצו להעתיק את המימוש.

הרישיון המלא ב־Hugging Face ↗