GPT
Q

Qwen-Image-Edit-InScene

קוד פתוח

peteromalletapache-2.02025-11-01

  • diffusers
  • image
  • editing
  • lora
  • scene-generation

ההרחבה הזו מייצרת זוויות חדשות לחלוטין מתוך תמונת מקור אחת בלי לאבד את הדמויות או את הסביבה. היא פותרת את הנטייה המציקה של מודל הבסיס להישאר צמוד מדי לתמונה המקורית.

  • 867 MBמשקל הקבצים
  • 1,707הורדות בחודש
  • 92לייקים

מה זה

מדובר בזוג קובצי LoRA שיושבים על מודל הבסיס Qwen-Image-Edit, במשקל כולל של 867 מגה בייט. מודל הבסיס נוטה לבצע תיקונים קטנים ושמרניים בלבד. פטר או'מאלט אימן את ההרחבות האלו ספציפית על צמדי שוטים שונים מאותה סצנה כדי לאלץ יצירה של שוטים חדשים לגמרי תוך שמירה על עקביות הדמויות, התאורה והמבנה הכללי.

החבילה מחולקת לשניים. הקובץ הראשון, InScene, מקבל תמונת רפרנס ומייצר זווית אחרת באותה סביבה כשמתחילים את הפרומפט בנוסח קבוע. הקובץ השני, InScene Annotate, מתוכנן לעבוד עם סימון מלבן ירוק שאתם מציירים על אזור מסוים בתמונה. במקום לחתוך את האזור טכנית, הוא מבין מה יש בתוך התיבה ומייצר ממנו קומפוזיציה חדשה לפי ההנחיות שלכם.

מתאים ל

  • יצירת זוויות נוספות לסצנה

    מייצר שוט חדש לחלוטין מתוך תמונת מקור אחת בלי לאבד את הדמויות או את הקשר המרחבי.

  • התמקדות באובייקט מסומן

    מזהה מלבן ירוק שציירתם על התמונה ובונה סביבו קומפוזיציה טבעית במקום סתם חיתוך גס.

  • עבודה מקומית ב־ComfyUI

    מאפשר לשלב תהליך יצירת סצנות עקבי בתוך סביבת עבודה קיימת באמצעות קובץ זרימה מוכן.

איפה זה נופל

המודלים נמצאים עדיין בגרסת בטא מוקדמת, גרסה 0.7, ויש בהם פגמים ברורים. המפתח מודה מראש שהם מתקשים בסצנות מורכבות עם המון שכבות ואלמנטים, בקומפוזיציות מופשטות, או בפרטים קטנים שמתנגשים עם המבנה של תמונת המקור. בנוסף מופיעות לפעמים בעיות בעומק השדה, כך שלא כדאי לבנות עליהם ליצירת פריימים מסחריים מורכבים בלי עין בוחנת על התוצאה.

שאלות
נפוצות

האם הקבצים האלו מספיקים כדי להריץ את המודל?

לא. אלו רק קובצי LoRA ששוקלים כ־867 מגה בייט. כדי להריץ אותם בפועל אתם חייבים להוריד קודם את מודל הבסיס Qwen-Image-Edit יחד עם ה־VAE והמקודדים הנדרשים.

איך מפעילים את המודל שמזהה סימונים?

אתם מציירים מלבן ירוק על האזור המבוקש בתמונת המקור, טוענים את משקלי InScene Annotate, וכותבים פרומפט שמסביר מה לעשות עם האובייקט המסומן, למשל להתקרב אליו או לשנות לו את התנוחה.

איך מריצים

אתם טוענים את המשקלים דרך diffusers בפייתון באמצעות צינור QwenImageEditPipeline עם bfloat16 על גבי כרטיס מסך, או מריצים אותם מקומית דרך ComfyUI עם קובץ הזרימה המוכן שמצורף למאגר. שימו לב שהמשקלים כאן הם רק שכבת LoRA קלה, כך שאתם חייבים להוריד בנפרד את מודל הבסיס המלא, ה־VAE והמקודדים כדי שזה ירוץ.

אם אתם עובדים ב־ComfyUI, ההתקנה מהירה כי הקובץ כולל את כל הקישורים הנדרשים. לא פורסם API רשמי מנוהל לגרסה הזו, כך שאם אין לכם חומרת אנבידיה מקומית עם זיכרון שמחזיק את מודל הבסיס של קוון, תצטרכו להרים שרת ענן משלכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("peteromallet/Qwen-Image-Edit-InScene")
img = pipe("a photo").images[0]

הקבצים

7 קבצים במאגר, 867 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש בלי תשלום תמלוגים, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומציינים שינויים אם ביצעתם כאלה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗