GPT
F

flux-controlnet-canny

קוד פתוח

XLabs-AIother2024-08-06

  • diffusers
  • Text-to-Image
  • ControlNet
  • Stable Diffusion
  • text-to-image

מתאם ControlNet מבוסס קצוות Canny שמתחבר למודל FLUX.1-dev. הוא נועד לתת שליטה מבנית מדויקת ביצירת תמונות לפי קווי מתאר של תמונת מקור.

  • 1.4 GBמשקל הקבצים
  • 1,136הורדות בחודש
  • 285לייקים

מה זה

מדובר במשקולת ControlNet במשקל 1.4 גיגה בייט שפותחה על ידי XLabs-AI ומיועדת לעבודה עם מודל הבסיס FLUX.1-dev של Black Forest Labs. במקום להסתמך רק על טקסט חופשי, המודל מקבל תמונת קלט שעברה זיהוי קצוות Canny ומייצר תמונה חדשה ששומרת על הקומפוזיציה והגבולות המדויקים של האובייקטים המקוריים, תוך שילוב הפרטים מהפרומפט.

הצוות שחרר את המשקולות לצד סקריפטים לאימון והסקה במאגר הגיטהאב x-flux, יחד עם תמיכה בהרצה דרך ComfyUI באמצעות תוסף ייעודי. כרטיס המודל לא מציג ציוני בנצ'מרק כמותיים או השוואות מספריות מול מתאמים אחרים, אלא מדגים את היכולת על ידי סקריפט פייתון ותמונות דוגמה שמציגות שמירה על קווי מתאר של דמויות ומבנים.

מתאים ל

  • שחזור סצנות לפי קומפוזיציה

    יצירת גרסאות חדשות לתמונות קיימות תוך שמירה מלאה על מיקום האובייקטים והפרופורציות.

  • עיצוב דמויות מקווי מתאר

    הפיכת סקיצות ידניות או קווי Canny של דמויות לתמונות מפורטות בעזרת תיאור טקסטואלי.

  • אימון ControlNet מותאם

    שימוש בסקריפטים ובפורמט המובנה של הצוות כדי לאמן מתאמים על נתונים פרטיים.

איפה זה נופל

כרטיס המודל מספק מעט מאוד מידע טכני על מגבלות, ולא מפרט את גודל הדאטה-סט ששימש לאימון או את התנהגותו ברזולוציות שונות. המודל מוגבל לשפה האנגלית בלבד לפי ההגדרות שלו. בנוסף, הוא תלוי לחלוטין באיכות מודל הבסיס ואיכות חילוץ הקווים של Canny, כך שקווים מקוטעים או עמוסים מדי בתמונת הקלט עלולים לייצר עיוותים ויזואליים בתוצאה הסופית.

אותה משפחה

flux-controlnet-canny יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא. הקובץ כפוף ישירות לרישיון הלא מסחרי של FLUX.1-dev. כל שימוש עסקי או יצירת הכנסה מהמודל אסורים על פי תנאי הרישיון.

האם הקובץ של ה־1.4 גיגה בייט מספיק כדי להריץ תמונות?

לא. זהו מתאם ControlNet בלבד ולא מודל עצמאי. כדי להפיק תמונה חייבים לטעון במקביל גם את מודל הבסיס FLUX.1-dev, שדורש משאבי זיכרון וכוח עיבוד משמעותיים.

איך מזינים קלט למודל בקוד?

מריצים את demo_controlnet_inference.py ממאגר x-flux עם דגלי הנתיב למשקולות, נתיב לתמונת השליטה שחולצו ממנה קווים, והפרומפט הרצוי באנגלית.

איך מריצים

ההסקה מתבצעת מקומית עם סקריפט הפייתון הייעודי של הפרויקט, demo_controlnet_inference.py, או דרך תזרים עבודה ב־ComfyUI. לפקודה מעבירים את קובץ המשקולות controlnet.safetensors, את תמונת השליטה ואת הפרומפט הרצוי באנגלית.

המתאם שוקל אמנם רק 1.4 גיגה בייט, אבל הוא לא רץ לבד. הוא דורש טעינה מלאה של FLUX.1-dev, מודל כבד שדורש כרטיס מסך חזק מאוד עם נפח זיכרון משמעותי כדי לרוץ בקצב סביר. אם אין לכם חומרה ייעודית מקומית עם מעבד גרפי מתאים, קריאה לפתרון מנוהל חיצוני תהיה זולה ופשוטה בהרבה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("XLabs-AI/flux-controlnet-canny")
img = pipe("a photo").images[0]

הקבצים

3 קבצים במאגר, 1.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר בתור other, והמפתחים מציינים במפורש כי הקובץ כפוף לרישיון הלא מסחרי של FLUX.1 dev. המשמעות ברורה ופשוטה, אסור להשתמש במודל הזה למוצר מסחרי, שירות בתשלום או כל פעילות מניבת הכנסה. הוא מתאים למחקר, ניסויים אישיים ובדיקות היתכנות בלבד.

הרישיון המלא בעמוד המודל ↗