GPT
Q

Qwen-Image-Layered

קוד פתוח

Qwenapache-2.02025-12-17

  • diffusers
  • safetensors
  • image-text-to-image
  • en
  • zh

יש כאן גם סקירה על Qwen עצמו.

פירוק תמונה לשכבות RGBA נפרדות פותר את בעיית העריכה הגרפית המקומית. מדובר במודל של עשרים מיליארד פרמטרים שמבודד אלמנטים ומאפשר לשנות, להזיז או למחוק אותם בלי לפגוע בשאר התמונה.

  • 20Bפרמטרים
  • 53.8 GBמשקל הקבצים
  • 82,828הורדות בחודש
  • 1,147לייקים

מה זה

במקום לייצר תמונה חדשה מאפס בכל בקשת עריכה, המודל מפרק קובץ קיים לשכבות שקופות נפרדות. כל שכבה מכילה אובייקט, טקסט או רקע מבודדים פיזית. החלוקה הזו מאפשרת לבצע שינויי צבע, הזזה במרחב, שינוי קנה מידה ומחיקה נקייה של אובייקטים, תוך שמירה מלאה על כל מה שנמצא בשכבות האחרות.

הפירוק אינו מוגבל למספר קבוע מראש ויכול להפריד לשלוש או שמונה שכבות לפי הצורך. בנוסף, המודל תומך בפירוק רקורסיבי, שבו לוקחים שכבה אחת שנוצרה ומפרקים אותה שוב לתת שכבות, מה שמתאים לעיבוד גרפי עמוק של עיצובים מורכבים.

מתאים ל

  • עריכת תמונות מבודדת

    מחיקה, הזזה או שינוי צבע של אובייקטים על גבי שכבות RGBA נפרדות מבלי לעוות את הרקע שמאחוריהם.

  • פירוק עיצובים למצגות

    הפרדת אלמנטים גרפיים ושקופיות לרכיבים בודדים בעזרת הספרייה המובנית python-pptx.

  • הכנת נכסים לאנימציה

    בידוד דמויות ורכיבים סטטיים לשכבות שקופות עבור מנועי גרפיקה ואנימציה דו ממדית.

איפה זה נופל

המודל תומך בהנחיות באנגלית ובסינית בלבד, כך שטקסטים בעברית אינם נתמכים ישירות בעבודה מולו. עריכות מתקדמות יותר כמו החלפת דמות או שינוי כיתוב בתוך שכבה דורשות שילוב של מודל נפרד, Qwen-Image-Edit, ולא מתבצעות על ידי המודל הזה לבדו. בנוסף, מודלים של פירוק שכבות נוטים לפספס חיתוכים מורכבים כמו שיער, שקיפויות עדינות או צללים, ויש לבדוק ידנית את איכות המסכות לפני שילוב בתהליך אוטומטי.

שאלות
נפוצות

האם המודל עצמו מייצר אובייקטים חדשים בשכבה?

לא. המודל אחראי על פירוק התמונה לשכבות RGBA ופעולות בסיסיות כמו הזזה או מחיקה. שינוי תוכן פנימי, כמו החלפת אדם באחר או שינוי טקסט, דורש מודל עריכה נוסף.

כמה זיכרון כרטיס מסך נדרש להרצה שלו?

המשקולות לבדן תופסות מעל 53 גיגה בייט. להרצה יציבה בזיכרון מלא תצטרכו כרטיס עם 80 גיגה בייט זיכרון וידאו, אלא אם תשתמשו בכימות של המשקולות.

איך מריצים

כדי להריץ אותו מקומית תצטרכו להוריד 53.8 גיגה בייט שמחולקים ל־33 קבצים, ולהשתמש בספריית diffusers יחד עם transformers בגרסה 4.51.3 ומעלה. עם עשרים מיליארד פרמטרים, תזדקקו לכרטיס מסך מקצועי עם לפחות 48 או 80 גיגה בייט זיכרון רק כדי לטעון אותו ולעבד תמונות ברזולוציה סבירה.

אם אין לכם שרת ייעודי עם חומרה ברמה הזו, עדיף להמתין לממשקי ענן או להריץ דרך שירות חיצוני, כי עלות הברזל המקומי תהיה גבוהה מאוד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Qwen/Qwen-Image-Layered")
img = pipe("a photo").images[0]

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗