GPT
F

FLUX.1-dev-ControlNet-Depth

קוד פתוח

Shakker-Labsother2024-08-23

  • diffusers
  • safetensors
  • Text-to-Image
  • ControlNet
  • Diffusers

מתאם עומק שנבנה במיוחד עבור מודל הבסיס של פלוקס. אתם מקבלים שליטה מדויקת במבנה המרחבי של התמונה בלי לאבד את איכות היצירה.

  • 1.6Bפרמטרים
  • 3.0 GBמשקל הקבצים
  • 1,543הורדות בחודש
  • 86לייקים

מה זה

מדובר במתאם קונטרול-נט שמיועד לעבוד ישירות עם FLUX.1-dev, פרי פיתוח משותף של צוות InstantX ו־Shakker Labs. במקום לנסות להנדס פרומפטים כדי לקבל זווית צילום או מרחק מדויק בין אובייקטים, אתם מזינים מפת עומק ומקבלים תמונה ששומרת על הגאומטריה המקורית. המודל בנוי מארבעה בלוקים כפולים ועוד בלוק בודד של ארכיטקטורת הטרנספורמר של פלוקס, וכולל כ־1.6 מיליארד פרמטרים שיושבים בקבצים במשקל כולל של שלושה גיגה-בייט.

האימון נעשה על שילוב של תמונות אמיתיות ותמונות סינתטיות ברזולוציה של 1024 פיקסלים, תוך שימוש במפות עומק שחולצו באמצעות Depth-Anything-V2. זה אומר שהוא מבין היטב פרספקטיבה תלת-ממדית, אבל גם דורש שתעבדו בצורה מסודרת עם חילוץ עומק דומה כדי לקבל תוצאות עקביות.

מתאים ל

  • העברת סגנון עם שימור מבנה

    שומר על המבנה המרחבי המדויק של הסצנה המקורית בעזרת מפת עומק, ומאפשר להחליף חומרים וסגנון ויזואלי.

  • שחזור סצנות תלת-ממד

    מאפשר לייצר רנדרים ריאליסטיים מתוך מודלים גולמיים בתוכנות תלת-ממד, תוך שמירה על העומק והמרחקים.

  • קומפוזיציה מדויקת בפרסום

    מקבע את מיקום האובייקטים והרקע בדיוק לפי תבנית נתונה, בלי צורך להילחם בניסוחי פרומפטים מורכבים.

איפה זה נופל

היוצרים מציינים טווח עבודה צר מאוד לעוצמת ההשפעה, בין 0.3 ל־0.7, מה שמעיד על רגישות גבוהה. חריגה מהערכים האלה עלולה לשבור את התמונה לחלוטין או למחוק את השפעת העומק. בנוסף, הוא אומן על מפות ספציפיות שחולצו עם Depth-Anything-V2, כך שאם תזינו מפות עומק ממקור אחר או באיכות נמוכה, המודל עלול לייצר ארטיפקטים משונים. הוא תומך באנגלית בלבד ולא מציע שליטה מובנית בסוגי בקרה נוספים.

שאלות
נפוצות

איזו חומרה אני צריך כדי להריץ אותו בפועל?

המתאם עצמו שוקל שלושה גיגה-בייט, אבל הוא מתחבר ישירות למודל FLUX.1-dev שדורש משאבים כבדים מאוד. תצטרכו כרטיס מסך מודרני עם לפחות 24 גיגה-בייט זיכרון כדי לייצר תמונות ברזולוציה מלאה בלי קריסות.

איך מייצרים את מפות העומק עבור המודל הזה?

האימון בוצע תוך שימוש במפות שנוצרו עם Depth-Anything-V2. כדאי להשתמש באותו כלי בדיוק לחילוץ העומק מתמונות המקור שלכם, אחרת המודל עלול להגיב בצורה פחות מדויקת.

איך מריצים

אתם טוענים אותו דרך ספריית diffusers יחד עם מודל הבסיס FLUX.1-dev. הקונטרול-נט עצמו שוקל שלושה גיגה-בייט, אבל הוא לא רץ לבד, אלא מצטרף למודל בסיס כבד מאוד שדורש כרטיס מסך חזק עם שפע זיכרון וידאו. כדי להריץ הכל מקומית ברזולוציה המקורית תצטרכו כרטיס חזק של 24 גיגה-בייט ומעלה.

המפתחים ממליצים להגדיר את עוצמת ההשפעה של המתאם על ערך שבין 0.3 ל־0.7. אם תחרגו מעבר לזה, התוצאה עלולה לסבול מעיוותים קשים, ואם תרדו נמוך מדי, המבנה המרחבי ייעלם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Shakker-Labs/FLUX.1-dev-ControlNet-Depth")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר בתור other ואינו רישיון קוד פתוח סטנדרטי. Shakker AI שומרים על כל זכויות היוצרים ומודל הבסיס עצמו כפוף למגבלות שימוש לא מסחריות, כך שאסור להשתמש בזה במוצר מסחרי בלי בדיקה משפטית והסדרה מול המפתחים.

הרישיון המלא בעמוד המודל ↗