GPT
F

FLUX.1-dev-Controlnet-Inpainting-Beta

קוד פתוח

alimama-creativeother2024-10-08

  • diffusers
  • safetensors
  • ComfyUI
  • Inpainting
  • image-to-image

שכבת בקרה לתיקון ועריכת תמונות ישירות ברזולוציית 1024 על 1024 מעל FLUX.1-dev. מתאימה למי שחייב עריכה מדויקת של אזורים מוגדרים בלי לאבד פרטים ובלי להסתמך על הגדלה מלאכותית.

  • 2.1Bפרמטרים
  • 4.0 GBמשקל הקבצים
  • 8,622הורדות בחודש
  • 430לייקים

מה זה

מדובר במודל ControlNet במשקל 2.1 מיליארד פרמטרים שמיועד למשימות Inpainting מעל מודל הבסיס FLUX.1-dev. צוות הפיתוח אימן אותו על 15 מיליון תמונות ממאגר LAION2B וממקורות פנימיים, במטרה לתקן אזורים ספציפיים בתמונה על בסיס מסיכה ופרומפט טקסטואלי באנגלית.

גרסת הבטא הזו מביאה תמיכה ישירה ברזולוציה מקורית של 1024 על 1024 פיקסלים בלי צורך בשלב Upscaling נפרד. לפי הנתונים וההשוואות של המפתחים מול גרסת האלפא הקודמת, המודל משפר את חדות הפרטים באזור המשוחזר ונשמע לפרומפטים מורכבים בצורה הדוקה יותר, במיוחד כשמתארים לא רק את האובייקט החסר אלא את הרקע והאווירה הכללית של התמונה כולה.

מתאים ל

  • עריכת פרטים בתמונות קיימות

    החלפת אובייקטים או תיקון פגמים ברזולוציה של 1024x1024 בלי לפגוע בסגנון של התמונה המקורית.

  • שילוב מוצרים ברקע חדש

    השתלת פריטי ריהוט או מוצרים לתוך חלל קיים לפי הנחיות טקסט, תוך שמירה על תאורה והקשר סביבתי.

  • הוספת טקסט על משטחים

    כתיבת כיתובים על גבי שלטים, עץ או אובייקטים בתוך התמונה לפי פרומפט מדויק.

איפה זה נופל

המודל מוגבל לשפה האנגלית בלבד, ופרומפטים בעברית פשוט לא יעבדו כאן כמו שצריך. בנוסף, הוא רגיש מאוד לניסוח. אם תתארו רק את החלק החסר ולא את שאר התמונה, התוצאה עלולה להיראות מנותקת מהקונטקסט. הביצועים שלו תלויים לחלוטין באיזון עדין בין עוצמת הבקרה לבין צעדי הסיום, ומשחק לא נכון עם ה־cfg עלול לפגוע באיכות התמונה.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי של 16 גיגה בייט?

לא בצורה ישירה על פי המפרט המקורי. המודל דורש כ־27 גיגה בייט זיכרון גרפי יחד עם מודל הבסיס ומודל השפה, כך שכרטיס עם 16 גיגה יקרוס אלא אם תשתמשו בקוונטיזציה כבדה מאוד לחלקי המערכת האחרים.

במה גרסת הבטא טובה יותר מגרסת האלפא?

הבטא מטפלת ישירות ברזולוציית 1024 פיקסלים במקום להזדקק להגדלה מלאכותית, מחזירה יותר פרטים באזור המסיכה ומציגה דיוק גבוה יותר בהיענות להוראות הטקסט.

איך מריצים

כדי להריץ את המודל מקומית תצטרכו שילוב של diffusers בגרסה 0.30.2 לפחות או סביבת ComfyUI עם תמיכה ב־FLUX. המודל עצמו שוקל 4 גיגה בייט, אבל הוא רץ מעל FLUX.1-dev. בריצת ComfyUI עם משקלי FP8 למודל הבסיס ומודל שפה T5xxl ב־FP16 על גבי מעבד גרפי H20, צריכת הזיכרון מגיעה ל־27 גיגה בייט של VRAM.

זמני ההסקה עומדים על 26 שניות עבור true_cfg של 1.0, ומזנקים ל־48 שניות אם מעלים את הערך ל־3.5 ב־30 צעדים. אפשר לשלב אותו גם עם LoRA מזוקק של 8 צעדים כמו FLUX.1-Turbo-Alpha כדי לקצר זמנים. אם אין לכם כרטיס עם לפחות 32 גיגה בייט זיכרון גרפי פנוי, עדיף להריץ את זה על שרת ענן ייעודי לפי שעה ולא על חומרה מקומית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("alimama-creative/FLUX.1-dev-Controlnet-Inpainting-Beta")
img = pipe("a photo").images[0]

הקבצים

5 קבצים במאגר, 4.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים שוחררו תחת רישיון FLUX.1-dev הלא מסחרי. המשמעות פשוטה: מותר להשתמש במודל למחקר, ניסויים אישיים ובדיקות פנימיות, אך אסור לשלב אותו בשום מוצר מסחרי, שירות בתשלום או הפקה עסקית.

הרישיון המלא בעמוד המודל ↗