GPT
Q

Qwen-Image-Edit-2511

קוד פתוח

Qwenapache-2.02025-12-17

  • diffusers
  • safetensors
  • image-to-image
  • en
  • zh

יש כאן גם סקירה על Qwen עצמו.

עריכת תמונות מבוססת טקסט שיודעת לשמור על תווי פנים של דמויות ועל פרטים הנדסיים. שווה לבדוק אותו אם נמאס לכם ממודלים שמשנים את כל התמונה בכל פעם שמבקשים לתקן פרט קטן.

  • 20Bפרמטרים
  • 53.8 GBמשקל הקבצים
  • 302,580הורדות בחודש
  • 1,345לייקים

מה זה

מדובר במודל של עשרים מיליארד פרמטרים שמיועד למשימות תמונה לתמונה, עם דגש על עריכה ושמירה על עקביות. הגרסה הזו מגיעה אחרי גרסת 2509 ומתמקדת בבעיה המרכזית של עריכה גנרטיבית, שהיא הנטייה של המודל לסטות מהמקור ולאבד את זהות הדמות או את המבנה המקורי.

בפועל הוא מטפל בעקביות של פנים בדיוקנאות, יודע לחבר תמונות של שני אנשים נפרדים לתמונה קבוצתית אחת, ומביא יכולות מובנות של שינוי זווית צפייה ושליטה בתאורה שהוטמעו ישירות לתוך משקולות הבסיס. בנוסף, הוא מכוון ליישומים טכניים כמו החלפת חומרים על גבי רכיבים תעשייתיים ושרטוט קווי עזר גיאומטריים.

מתאים ל

  • עריכת תמונות פרופיל

    הוא שומר על תווי הפנים של המצולם ומאפשר לשנות סגנון או רקע בלי לאבד את זהות האדם.

  • שילוב דמויות בתמונה אחת

    מאפשר לקחת שתי תמונות נפרדות של אנשים ולחבר אותן לתצלום משותף בעל מראה אחיד.

  • הדמיית מוצרים תעשייתיים

    מתאים להחלפת חומרים על גבי חלקים הנדסיים והפקת וריאציות עיצוב מרובות מאותו פריט.

איפה זה נופל

המודל תומך רק באנגלית ובסינית, כך שאי אפשר לתת לו הנחיות עריכה בעברית והוא לא יידע להתמודד עם טקסט מקומי. מדובר במפלצת של עשרים מיליארד פרמטרים, מה שאומר שזמני ההסקה ארוכים וצריכת המשאבים כבדה מאוד. בנוסף, כרטיס המודל לא מציג מדדי ביצועים כמותיים או ציוני בנצ'מרק, אלא רק דוגמאות ויזואליות נבחרות, כך שחובה לבדוק אותו עצמאית על תרחישי קצה לפני שסומכים עליו בתהליך ייצור.

שאלות
נפוצות

אפשר להריץ את המודל על מחשב אישי רגיל?

לא. המודל שוקל 53.8 גיגה בייט ומחזיק עשרים מיליארד פרמטרים. כדי לטעון אותו ולבצע עיבוד תמונה דרוש כרטיס מסך מקצועי עם זיכרון גרפי גדול במיוחד, שאינו קיים בחומרה צרכנית רגילה.

האם המודל מבין פרומפטים בעברית?

לא. המודל מאומן רשמית רק על אנגלית וסינית. הנחיות עריכה בעברית כנראה לא יובנו כראוי או ייצרו שגיאות, ולכן יש לכתוב את הפקודות באנגלית.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־53.8 גיגה בייט, כך שאי אפשר להריץ אותו על כרטיס מסך ביתי רגיל. בשביל להעלות עשרים מיליארד פרמטרים ולהריץ עריכה בלי לקרוס מחוסר זיכרון, תצטרכו מאיץ עם זיכרון גרפי גבוה מאוד, כמו כרטיסי שרת ייעודיים.

ההרצה מתבצעת דרך ספריית diffusers בגרסת הפיתוח שלה. אם אין לכם תשתית ענן מתאימה עם חומרה חזקה, החזקת שרת פרטי למודל כזה תעלה לא מעט כסף, וברוב המקרים עדיף לפנות ל־API חיצוני או להשתמש בממשק ההדגמה של המפתחים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Qwen/Qwen-Image-Edit-2511")
img = pipe("a photo").images[0]

הקבצים

35 קבצים במאגר, 53.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות מופצים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗