GPT
F

FLUX.1-dev-ControlNet-Union-Pro

קוד פתוח

Shakker-Labsother2024-08-23

  • diffusers
  • safetensors
  • Text-to-Image
  • ControlNet
  • Diffusers

במקום להוריד מודל נפרד לכל סוג שליטה, הקובץ הזה מרכז שבעה מצבים שונים בתוך מתאם אחד שמיועד לעבודה ישירה מעל FLUX.1-dev.

  • 3.3Bפרמטרים
  • 6.2 GBמשקל הקבצים
  • 8,472הורדות בחודש
  • 629לייקים

מה זה

מדובר במתאם מסוג ControlNet שמביא יכולות הכוונה מגוונות למודל FLUX.1-dev. במקום להחזיק משקלים שונים לתנוחת גוף, קצוות ועומק, הוא מאחד שבעה מצבי שליטה שונים בקובץ יחיד: canny, tile, depth, blur, pose, gray ואיכות נמוכה. זו גרסת ה־Pro שפותחה על בסיס הגרסה הרגילה של InstantX, כשההבדל המרכזי הוא אימון על יותר דאטה ויותר צעדים כדי לקבל תוצאות מדויקות ויציבות יותר.

היתרון המעשי כאן הוא חיסכון בניהול מודלים והיכולת לשלב אותו יחד עם מתאמים נוספים במקביל. אפשר להגדיר לו מצב ספציפי לפי מספר ולהריץ אותו לצד מודל ייעודי אחר אם צריך שליטה מורכבת במיוחד.

מתאים ל

  • הנחיית פוזה לקומפוזיציה

    שליטה בתנוחת דמויות לפי תמונת שלד באמצעות מצב pose, בלי צורך להחזיק מודל ייעודי נפרד לעניין.

  • שחזור ושדרוג תמונה

    שימוש במצבי tile או low quality כדי לחדד פרטים בתמונות קיימות ולבנות אותן מחדש בעזרת מודל הבסיס.

  • שמירה על מבנה עם קווי מתאר

    הפקת תמונות שמבוססות בדיוק על קווי canny או מפות עומק עבור עיצוב מוצר והדמיות אדריכליות.

איפה זה נופל

המודל הזה תומך בשפה האנגלית בלבד, כך שהנחיות בעברית לא יעבדו כאן. מעבר לזה, טווח ההשפעה המומלץ מוגבל ל־0.3 עד 0.8, מה שאומר שחריגה מהערכים האלה עלולה לייצר עיוותים או להתעלם מתמונת המקור. חיסרון נוסף הוא הצורך בהתקנת גרסת פיתוח מותאמת של diffusers כדי להריץ את הקוד, מה שעלול לסבך את סביבת העבודה בפרודקשן.

שאלות
נפוצות

איך מחליפים בין סוגי השליטה השונים?

המעבר מתבצע בקוד דרך פרמטר מספרי שנע בין אפס לשש. אפס מיועד ל־canny, שתיים לעומק, ארבע לתנוחה, ושאר המספרים מכסים מצבים כמו blur ו־tile.

האם אפשר להריץ אותו יחד עם מודל שליטה נוסף?

כן, המודל תומך בריצה משולבת דרך FluxMultiControlNetModel. אפשר להגדיר לו מצב עבודה מסוים ולהוסיף במקביל מתאם חיצוני ייעודי כמו מודל עומק נפרד.

איך מריצים

המודל שוקל מעל שישה גיגהבייט ומוסיף עוד 3.3 מיליארד פרמטרים על גבי מודל הבסיס, שכבר בעצמו כבד מאוד. כדי להריץ את שניהם יחד בזיכרון תצטרכו כרטיס מסך חזק עם נפח VRAM משמעותי, במיוחד בעבודה עם bfloat16. אם אין לכם חומרה כזו זמינה, עדיף להשתמש בתשתיות ענן או בשירותי API חיצוניים.

בצד התוכנה, השימוש דורש התקנה ישירה של diffusers מהמקור בגלל תלויות בקוד שטרם נכנסו לגרסה רשמית בעת הפרסום. מריצים אותו דרך FluxControlNetModel, והיוצרים ממליצים לשמור על משקל conditioning בין 0.3 ל־0.8 כדי לא לשבור את התמונה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Shakker-Labs/FLUX.1-dev-ControlNet-Union-Pro")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־other ואינו מפורט ישירות בכרטיס המודל, למעט ציון שכל הזכויות שמורות ושהבסיס הוא FLUX.1-dev. בלי תנאי רישיון ברורים ומוגדרים, לא מומלץ לשלב אותו במוצר מסחרי לפני בדיקה משפטית או פנייה ישירה ליוצרים לקבלת אישור מפורש.

הרישיון המלא בעמוד המודל ↗