GPT
Q

Qwen-Image-Edit-2509-Fusion

קוד פתוח

dx8152apache-2.02025-10-22

  • diffusers
  • lora
  • image-to-image

תוספת LoRA קטנה לעריכת תמונות שמתמקדת בשילוב מוצר ברקע קיים. היא מתקנת תאורה ופרספקטיבה כדי שההדבקה תיראה טבעית ולא כמו גזירה חובבנית.

  • 225 MBמשקל הקבצים
  • 4,682הורדות בחודש
  • 253לייקים

מה זה

מדובר במשקולת LoRA בגודל 225 מגה בייט שמיועדת למשימות תמונה לתמונה, על גבי מודל הבסיס של Qwen לעריכת תמונות. המטרה המוגדרת שלה היא פתרון בעיית המיזוג, כלומר לקחת תמונה של חפץ או מוצר, לשתול אותו בתוך סביבה חדשה, ולגרום לו להיראות כאילו צולם שם במקור. היוצר אימן את המודל באמצעות תשתית ModelScope, והעבודה נעשית בעזרת מילות הפעלה ייעודיות בסינית שמתמקדות בתיקון זווית הצפייה והתאמת האור והצללים.

בכרטיס אין מדדי ביצועים רשמיים, מבחני השוואה או מספרים שמעידים על אחוזי הצלחה, אלא הדגמות ויזואליות בלבד. במקום נתונים טכניים יבשים על איכות, המפתח צירף סרטוני יוטיוב וגיפים שמראים את הפעולה בזמן אמת. המשמעות היא שאין פה הוכחה מספרית ליציבות התוצאות, ותצטרכו לבדוק בעצמכם אם הוא שומר על פרטי המוצר המקוריים מבלי לעוות אותו ברגע שמשנים לו את התאורה.

מתאים ל

  • שתילת מוצר בקטלוג

    התאמת תמונת סטודיו נקייה של פריט מסחרי לסצנת רקע מורכבת עם תאורה מתאימה.

  • תיקון פרספקטיבה

    התאמת זווית הצילום של חפץ גזור כדי שיישב נכון מבחינה גיאומטרית בתוך חלל קיים.

  • התאמת תאורה והצללה

    יצירת צללים ריאליסטיים ואיזון אור חוזר על גבי אובייקט שמודבק בסביבה חשוכה או בהירה.

איפה זה נופל

ההפעלה של המודל נשענת על מילות הפעלה בסינית, מה שמסבך את השילוב שלו במערכות אוטומטיות שעובדות באנגלית או בעברית בלי תרגום מקדים. תלות החובה במשקולת נוספת כדי לקבל תוצאות יוצרת עוד נקודת כשל בתהליך, ומכיוון שאין שום מידע כמותי על שיעורי עיוות או כשלים, קשה לדעת מראש איך הוא יתמודד עם מוצרים מורכבים או טקסט שמופיע על גבי האובייקט.

שאלות
נפוצות

אפשר להריץ אותו כמודל עצמאי?

לא. מדובר בקובץ LoRA קטן שמתלבש על מודל עריכה ראשי של Qwen, והיוצר מבהיר שצריך לטעון יחד איתו גם את המשקולת של Lightning.

איך מפעילים את הפקודה הנכונה לעריכה?

הכרטיס מגדיר מילות הפעלה בסינית שמתמקדות בהטמעת התמונה ותיקון פרספקטיבה, כך שיש להזין אותן בהנחיה כדי לקבל את האפקט.

האם הוא דורש מחשב חזק במיוחד?

הקובץ שוקל רק 225 מגה בייט, אבל צריכת הזיכרון נקבעת לפי מודל הבסיס של Qwen שרץ ברקע.

איך מריצים

המשקל הכולל מסתכם ב־225 מגה בייט על פני ארבעה קבצים, כך שזמן ההורדה והאחסון המקומי כמעט אפסיים. כדי להריץ את זה בפועל, אתם צריכים סביבה שתומכת ב־diffusers, כמו ComfyUI או קוד פייתון פרטי, ולהוריד את הקובץ לתיקיית המשקולות הרגילה. המפתח מציין במפורש שחובה להשתמש בו במקביל לעוד LoRA בשם Qwen-Image-Lightning, מה שאומר שצריך להגדיר שרשרת עבודה שמשלבת את שניהם יחד.

דרישות החומרה נגזרות לחלוטין ממודל הבסיס של Qwen ולא מתוספת המשקל הזו, כך שצריך כרטיס מסך עם מספיק זיכרון וידאו שמסוגל להחזיק את מודל התמונה הראשי. למי שאין כרטיס גרפי מתאים בשרת או במחשב, היוצר מספק קישור חיצוני להרצה דרך RunningHub, מה שמאפשר לבדוק את הביצועים בענן בלי להתקין סביבת עבודה מקומית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("dx8152/Qwen-Image-Edit-2509-Fusion")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 225 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. המפתח הוסיף בכרטיס בקשה לתרומה בפייפאל עבור שימוש עסקי, אך מבחינה משפטית תנאי אפאצ'י אינם מחייבים תשלום כזה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗