GPT
Q

Qwen-Image-Edit-2509

קוד פתוח

Qwenapache-2.02025-09-22

  • diffusers
  • safetensors
  • image-to-image
  • en
  • zh

יש כאן גם סקירה על Qwen עצמו.

עריכת תמונות מונחית טקסט שמסוגלת לשלב בין תמונות שונות, לשנות פוזות ולערוך טקסט ישירות על התמונה תוך שמירה על תווי הפנים ופרטי המוצר.

  • 20Bפרמטרים
  • 53.8 GBמשקל הקבצים
  • 457,619הורדות בחודש
  • 1,239לייקים

מה זה

מדובר בגרסת ספטמבר של מודל עריכת התמונות מבית Qwen, שמביאה תמיכה בקלט של מספר תמונות במקביל לעומת מודלים שעובדים על פריים בודד. אפשר להזין לו בין תמונה אחת לשלוש תמונות, ולבקש ממנו חיבורים כמו אדם בתוך רקע חדש, שילוב מוצר עם דמות, או יצירת סצנה משותפת לשני אנשים שונים.

הדגש כאן הוא על שמירת העקביות של האובייקט המקורי. הוא שומר על תווי הפנים של המצולם גם בשינוי זווית וסגנון, יודע לשמר צורה של מוצר מסחרי לצורך פוסטרים, וכולל יכולת לערוך גופנים, צבעים וטקסט שמופיע בתוך התמונה עצמה. בנוסף יש בו תמיכה מובנית בתנאי ControlNet כמו מפות עומק, שלדים וסקיצות בלי להזדקק לתוספים חיצוניים מסורבלים.

מתאים ל

  • החלפת רקע למוצרים

    לקיחת תמונה של מוצר על רקע פשוט והפיכתה לפוסטר פרסומי מלא תוך שמירה על מראה המוצר המקורי.

  • עריכת טיפוגרפיה בתמונה

    שינוי טקסט, גופן, צבע וחומר בתוך גרפיקה קיימת באנגלית או בסינית בלי להרוס את העיצוב סביבו.

  • שינוי תנוחה לפי שלד

    שימוש במפות נקודות מפתח כדי לשנות פוזה של דמות אנושית בלי לאבד את תווי הפנים שלה.

איפה זה נופל

למרות היכולת לקבל מספר תמונות, הביצועים האופטימליים מוגבלים לטווח של אחת עד שלוש תמונות בלבד, ומעבר לזה התוצאה תיפגע. המודל מתמקד באנגלית ובסינית, כך שכל עריכת טקסט או הנחיה בעברית לא נתמכת כאן באופן רשמי וצפויה להיכשל. אין בכרטיס שום נתוני מדידה מספריים או השוואות בנצ'מרק, ולכן אי אפשר לדעת מראש מה אחוז ההצלחה האמיתי שלו בשמירה על פרטי פנים בלי לבדוק כל מקרה לגופו.

שאלות
נפוצות

האם המודל תומך בעריכת שלטים וטקסטים בעברית?

לא. המודל אומן ותומך רשמית רק באנגלית ובסינית. הוא יודע לשנות גופנים וטקסטים ברמת דיוק גבוהה בשפות האלו, אבל בעברית הוא צפוי לייצר ג'יבריש או לעוות את האותיות.

כמה תמונות אפשר להזין לו בבת אחת כדי לייצר תמונה חדשה?

הכרטיס מציין שהביצועים האופטימליים מושגים עם תמונה אחת עד שלוש תמונות קלט בלבד. אפשר לשלב למשל שתי דמויות ורקע, אבל הזנה של יותר משלוש תמונות כבר חורגת מהטווח המומלץ ותפגע בעקביות.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־53.8 גיגה בייט, מה שאומר שאתם חייבים כרטיס מסך רציני עם זיכרון וידאו גבוה מאוד כדי לטעון אותו, או להשתמש בשרת ענן ייעודי עם מאיצים מתאימים. מריצים אותו בעזרת ספריית diffusers בגרסה האחרונה מגיטהאב.

אם אתם לא בונים שירות של עריכות כבדות שדורש שליטה מלאה בפרמטרים או פרטיות מקומית מוחלטת, להרים מכונה עם 54 גיגה בייט של משקלים רק בשביל כמה ניסיונות זה יקר ומסורבל. במצב כזה עדיף לבדוק אותו קודם בהדגמה או לפנות ל־API אם יש כזה בסביבה שלכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Qwen/Qwen-Image-Edit-2509")
img = pipe("a photo").images[0]

הקבצים

35 קבצים במאגר, 53.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. זהו רישיון פתוח ומתירני שמאפשר להשתמש במודל לצרכים מסחריים, לשנות אותו ולשלב אותו בתוך מוצרים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗