GPT
Q

Qwen-Image-Edit

קוד פתוח

Qwenapache-2.02025-08-17

  • diffusers
  • safetensors
  • image-to-image
  • en
  • zh

יש כאן גם סקירה על Qwen עצמו.

זה מודל לעריכת תמונות מונחית טקסט שמסוגל לשנות פרטים קטנים בלי לחרב את שאר הפיקסלים, וגם לשלוט בטקסט כתוב בתוך התמונה.

  • 20Bפרמטרים
  • 53.8 GBמשקל הקבצים
  • 139,172הורדות בחודש
  • 2,506לייקים

מה זה

הארכיטקטורה כאן מחברת בין מודל דיפוזיה של עשרים מיליארד פרמטרים לבין רכיב הראייה Qwen2.5-VL שמבין את הסמנטיקה, לצד מקודד VAE ששומר על המראה הקיים. השילוב הזה מאפשר לו לפעול בשני אופנים נפרדים. הוא יכול לבצע שינויים סמנטיים מלאים, כמו סיבוב של אובייקט בתלת־ממד ב־90 או 180 מעלות ושינוי סגנון ציור, תוך שמירה על זהות הדמות.

היכולת השנייה והמעניינת יותר היא עריכת מראה נקודתית. אפשר להוסיף אלמנט חדש עם השתקפויות מתאימות, להחליף בגדים, למחוק שערות בודדות או לשנות צבע של אות ספציפית בלי לגעת בשאר הפריים. בנוסף, הוא מתמודד עם עריכת טקסט קיים בתוך שלטים וכרזות באנגלית ובסינית, כולל התאמה לפונט ולגודל המקורי.

מתאים ל

  • עריכת טקסט בגרפיקה

    תיקון שגיאות או החלפת מילים באנגלית על גבי כרזות, שלטים ואריזות תוך שמירה על הגופן והעיצוב.

  • סיבוב אובייקטים וזוויות

    יצירת זוויות צפייה חדשות של דמות או מוצר ב־90 ו־180 מעלות תוך שמירה על עקביות הדמות.

  • ריטוש ושינוי אלמנטים

    החלפת רקעים ובגדים או הוספת פרטים לתמונה קיימת מבלי לשנות את הפיקסלים שמסביב.

איפה זה נופל

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד, כך שעריכת טקסט בעברית לא נתמכת כאן. גם בסינית, התיעוד מראה שהמודל מתקשה לעיתים עם אותיות מורכבות ודורש עריכה מדורגת בכמה שלבים עם תיחום ידני של אזורים כדי לתקן שגיאות. חמישים צעדי אינפרנס על מודל בגודל כזה יגרמו לזמני תגובה איטיים שלא מתאימים לכל תרחיש זמן־אמת.

שאלות
נפוצות

האם המודל תומך בעריכת טקסט בעברית בתוך תמונות?

לא. המודל מוגדר רשמית לעבודה באנגלית ובסינית בלבד. אם תנסו לערוך איתו טקסט עברי, התוצאות כנראה יהיו משובשות לחלוטין.

האם אפשר להריץ את המודל על מחשב נייד מקומי?

לא מומלץ לנסות. קובצי המשקלים לבדם שוקלים 53.8 גיגה־בייט ומכילים 20 מיליארד פרמטרים, מה שמחייב GPU חזק עם זיכרון VRAM גדול מאוד.

איך המודל מצליח לא להרוס את שאר התמונה בזמן עריכה?

הוא מפצל את העיבוד בין רכיב ויזואלי של Qwen2.5-VL שמבין את תוכן הבקשה לבין מקודד VAE שמקבע את הפיקסלים והמראה המקוריים.

איך מריצים

משקל הקבצים עומד על כמעט 54 גיגה־בייט ב־39 קבצים, וההרצה דורשת טעינה דרך ספריית diffusers בפורמט bfloat16. מודל בגודל 20B מחייב מעבד גרפי מקצועי וכבד עם זיכרון וידאו משמעותי, כך שכרטיס ביתי פשוט לא יספיק פה.

אם אתם מתכננים בדיקות ראשוניות או פיצ'ר שלא מצדיק תחזוקת שרת GPU ייעודי שדולק תמיד, אין היגיון להרים את זה לבד. במקרים כאלה עדיף לגשת לממשק של Qwen Chat או לשירות ענן שמחזיק את המודל מוכן ומחייב רק לפי קריאה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Qwen/Qwen-Image-Edit")
img = pipe("a photo").images[0]

הקבצים

39 קבצים במאגר, 53.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה של המודל בתוך מוצר, בלי חובת תשלום תמלוגים. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗