GPT
Q

Qwen-Image-ControlNet-Union

קוד פתוח

InstantXapache-2.02025-08-20

  • diffusers
  • safetensors
  • Image-to-Image
  • ControlNet
  • Diffusers

מודל בקרה מאוחד ל־Qwen-Image שמשלב canny, קווי מתאר רכים, עומק ותנוחת גוף בקובץ אחד. במקום להחזיק ארבעה מודלים שונים בזיכרון, מקבלים פתרון אחד שחוסך משאבים.

  • 1.8Bפרמטרים
  • 3.3 GBמשקל הקבצים
  • 16,345הורדות בחודש
  • 122לייקים

מה זה

במקום להוריד ולטעון מודל נפרד לכל סוג התניה, הצוות של InstantX דחס כאן ארבעה מצבי שליטה לתוך משקל יחיד: זיהוי קצוות חד (canny), קווים רכים, מפות עומק ותנוחות של DWPose. המבנה מבוסס על 5 בלוקים כפולים שנלקחו משכבות הטרנספורמר המקוריות של Qwen-Image, ואומן מאפס במשך 50 אלף צעדים על מאגר של 10 מיליון תמונות.

האימון נעשה ברזולוציה גבוהה של 1328 על 1328 פיקסלים ב־BFloat16, כך שהוא מותאם לתמונות מפורטות יחסית כבר מהקופסה. היתרון המעשי ברור: פחות בלגן בניהול קבצים בשרת ואפשרות לעבור בין סוגי קלט שונים באותו תהליך עבודה, בלי להחליף מודלים בזיכרון של כרטיס המסך.

מתאים ל

  • הפקת תמונות לפי תנוחה

    שליטה בפוזיציות של אנשים באמצעות DWPose ישירות בתוך סביבת Qwen-Image.

  • שמירה על קומפוזיציה ועומק

    שימוש במפות עומק כדי לבנות סצנות מורכבות בלי לאבד את מבנה החלל המקורי.

  • עבודה מבוססת שרטוט וסקיצות

    המרת קווי מתאר חדים או רכים לתמונות מוגמרות ברזולוציה גבוהה.

איפה זה נופל

היוצרים מציינים במפורש שהמודל מתקשה לשמר פרטים קטנים, במיוחד טקסט בפונט קטן, אלא אם מגדירים אותו במפורש בתוך הפרומפט. אם אתם צריכים ליצור פוסטרים או תוויות בלי לפרט בדיוק כל מילה באנגלית, התוצאה תימרח. מעבר לזה, הכרטיס מדווח רק על תמיכה בשפה האנגלית, כך ששילוב הוראות בעברית כנראה לא ייתן תוצאות עקביות.

שאלות
נפוצות

האם אפשר להשתמש ביותר מהתניה אחת באותה ריצה?

כן, המודל תומך בהסקה מרובת התניות במקביל. כדי לממש את זה ב־diffusers צריך להשתמש במימוש שנמצא ב־PR מספר 12215 של הספרייה.

איך כדאי לכתוב את הפרומפטים לקבלת תוצאה מדויקת?

המפתחים ממליצים על פרומפטים מפורטים ככל האפשר, במיוחד כשיש אלמנטים של טקסט בתמונה. במקום לכתוב פוסטר כללי, עדיף להגדיר במפורש את הטקסט שצריך להופיע ואת המיקום שלו.

איך מריצים

המודל שוקל 3.3 גיגהבייט ורץ דרך ספריית diffusers או ComfyUI, שיש לה תמיכה מובנית בו. תצטרכו כרטיס מסך עם מספיק זיכרון כדי להחזיק גם את מודל הבסיס של Qwen-Image וגם את ה־ControlNet עצמו, כך שבפועל מומלץ לעבוד עם מאיץ ייעודי בעל 16 גיגהבייט VRAM ומעלה ברזולוציות המקוריות.

בהרצה מקומית צריך להכין מראש את חילוץ ההתניות, למשל באמצעות AnylineDetector לקווים רכים או Depth-Anything לעומק, ולהגדיר את עוצמת השליטה בטווח שבין 0.8 ל־1.0. אם אתם לא רוצים לתחזק שרת כרטיסי מסך, אפשר להריץ אותו דרך Liblib AI שמציעה תמיכה מקוונת במודל.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("InstantX/Qwen-Image-ControlNet-Union")
img = pipe("a photo").images[0]

הרישיון

רישיון apache-2.0 מתיר שימוש חופשי בקוד ובמשקולות, כולל שימוש מסחרי, שינוי והפצה בתוך מוצרים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗