GPT
Q

Qwen-Image-ControlNet-Inpainting

קוד פתוח

InstantXapache-2.02025-09-08

  • diffusers
  • safetensors
  • Image-to-Image
  • ControlNet
  • Diffusers

מודל בקרה לעריכת תמונות שמביא יכולות מסיכה מקצועיות לתשתית של קוון. אם אתם רוצים להחליף אובייקטים או להרחיב גבולות ברזולוציה גבוהה, הוא נותן פתרון ממוקד.

  • 2.1Bפרמטרים
  • 4.0 GBמשקל הקבצים
  • 5,932הורדות בחודש
  • 121לייקים

מה זה

מדובר במודל קונטרול-נט שמיועד ספציפית למשימות של עריכת פנים התמונה והרחבה שלה החוצה על בסיס מסיכות. הוא בנוי משישה בלוקים כפולים שהועתקו ישירות משכבות הטרנספורמר של מודל הבסיס, ואומן מאפס על פני שישים וחמישה אלף צעדים עם מאגר של עשרה מיליון תמונות כלליות ותמונות של אנשים.

האימון נעשה ברזולוציה גבוהה למדי של 1328 על 1328 פיקסלים בדיוק של בי-פלוט 16. השילוב הזה הופך אותו למתאים לא רק להסרת רקעים פשוטה, אלא גם לשינוי טקסט בתוך תמונה קיימת ולהחלפת אובייקטים שלמים בלי לאבד את ההקשר החזותי הכללי.

מתאים ל

  • החלפת אובייקטים בתמונה

    החלפה של פריטים ספציפיים לפי מסיכה תוך שמירה על התאורה והסגנון של שאר התמונה.

  • עריכת טקסט קיים

    שינוי כיתובים על גבי שלטים או תוויות בדיוק של מסיכה בלי לשבור את המרקם המקורי.

  • הרחבת שוליים החוצה

    ציור שטחים חדשים מסביב לתמונה ברזולוציה גבוהה של 1328 פיקסלים בלי מריחות.

איפה זה נופל

היוצרים מודים במפורש שהמודל רגיש מאוד לניסוח הפרומפט שלכם. הוא נכשל אם נותנים לו הוראות ישירות כמו תחליף את החולצה, ודורש תיאור מלא ומפורט של כל התמונה, כולל הרקע וכולל האזור שעובר עריכה. בנוסף המודל אומן בשפה האנגלית בלבד, כך שאי אפשר להזין לו פרומפטים בעברית, ותצטרכו לבדוק היטב ידנית כל שינוי טקסטואלי בתמונה לפני שאתם סומכים עליו במוצר סופי.

שאלות
נפוצות

איזה סוג פרומפט צריך לכתוב כדי לקבל תוצאה טובה?

אל תכתבו פקודות ביצוע קצרות. המודל דורש תיאור רחב ומפורט שמסביר גם את מה שצריך להופיע בתוך המסיכה וגם את מה שנמצא מחוצה לה ברקע.

האם המודל תומך בהוראות בעברית?

לא. המודל מוגדר ומאומן באנגלית בלבד. אם תזינו הנחיות בעברית הוא כנראה יתעלם מהן או ייצר תוצאות לא צפויות, לכן יש לתרגם כל בקשה לאנגלית מראש.

מה צריך כדי להפעיל אותו בקומפי-יו-איי?

יש לוודא שהגרסה של קומפי-יו-איי היא לפחות 0.3.59, להוריד את קובץ המודל, ולהשתמש בתבנית העבודה הרשמית שפורסמה בריפו כדי לחבר אותו נכון למודל התמונה.

איך מריצים

המודל שוקל ארבעה גיגה-בייט ומכיל כ־2.1 מיליארד פרמטרים, אבל צריך לזכור שהוא לא רץ לבד אלא מולבש על מודל הבסיס באמצעות ספריית דיפיוזרס. כדי להריץ את שניהם יחד ברזולוציית המקור בלי לקבל שגיאות זיכרון תצטרכו כרטיס מסך חזק עם זיכרון וידאו נדיב.

מבחינת סביבת עבודה, יש לו תמיכה מובנית בקומפי-יו-איי מגרסה 0.3.59 ומעלה עם וורקפלו רשמי מוכן, וגם תמיכה חיצונית ברשת ליב-ליב. אם אין לכם חומרה ייעודית מקומית שסוחבת את השילוב הזה, הפעלה דרך שירות ענן או ווב תהיה הרבה יותר מעשית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("InstantX/Qwen-Image-ControlNet-Inpainting")
img = pipe("a photo").images[0]

הרישיון

המודל מופץ תחת רישיון אפאצ'י שתיים אפס. זה רישיון פתוח שמתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית בתוך המוצר שלכם. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים המקורית והצהרה על שינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗