GPT
N

Nunchaku-Qwen-Image-EDIT-2511

קוד פתוח

QuantFuncapache-2.02026-01-22

  • diffusers
  • custom_qwen_image
  • image-generation
  • multimodal
  • qwen

גרסאות מכווצות של מודל עריכת התמונות מבית Qwen להרצה מקומית ומהירה. פתרון ממוקד למי שרוצה לערוך תמונות לפי הוראות טקסט ומחפש ביצועים של C++ על כרטיסי מסך ביתיים או שרתים.

  • 72.6 GBמשקל הקבצים
  • 3,553הורדות בחודש
  • 109לייקים

מה זה

מדובר בנגזרת קוונטיזציה למודל Qwen-Image-Edit-2511, שנארזה מחדש בעזרת שיטת SVDQuant ומנוע מותאם של QuantFunc. המטרה כאן היא עריכת תמונות מונחית תמונת מקור וטקסט, תוך שילוב אנקודר הראייה והטקסט Qwen2.5-VL-7B. במקום להריץ את משקלי הדיפוזיה המקוריים בפייתון כבד, המפתחים כיווצו אותם לפורמטים של ארבע ביט.

לפי הנתונים, המנוע הייעודי מספק האצה של פי 2 עד פי 11 ביחס לצינורות עבודה רגילים של BF16 או FP16. המאגר מכיל מספר וריאנטים שנבדלים בדרגת הקירוב: רמות איכות גבוהה, מצב מאוזן, ומצב מהירות מרבית, בפורמטים של INT4 ושל FP4.

מתאים ל

  • עריכת תמונות בתוך ComfyUI

    שילוב בתהליכי עבודה קיימים עם LoRA בארבעה צעדים, למי שרוצה זמני רינדור קצרים משמעותית בעריכת תמונה לפי תמונה.

  • שרתי עיבוד עם חומרת FP4

    ניצול כרטיסי דור חדש להרצה במהירות גבוהה ובצריכת זיכרון נמוכה, מתאים לעיבוד אצוות של עריכות גרפיות.

  • החלפת אובייקטים והשלמת תמונה

    ביצוע תיקונים ועריכות מקומיות מונחות טקסט על בסיס תמונת מקור קיימת, בלי לשלוח מידע לספק ענן חיצוני.

איפה זה נופל

המודל תומך רק באנגלית ובסינית, כך שפרומפטים בעברית ידרשו תרגום מראש ולא יעבדו היטב ישירות. בנוסף, מדובר בהטמעה שדורשת קבצי הרצה מקומפלים של צד שלישי, ולא בצינור דיפיוזרס נקי שעובד מהקופסה בלי תלויות חיצוניות.

גרסאות המהירות המרבית מקצצות את ערך ה־low-rank עד ל־32 בלבד. קיצוץ כזה עלול לפגוע בפרטים עדינים בתמונה, ולכן חובה לבדוק את איכות הפלט מול גרסאות ה־256 לפני שמחליטים להטמיע את המצב המהיר בתהליך אוטומטי.

שאלות
נפוצות

אני חייב להוריד את כל 72 הגיגה כדי שזה יעבוד?

לא. המאגר מכיל את כל הווריאנטים יחד, מאיכות מרבית ועד מהירות מקסימלית ב־INT4 וב־FP4. בחרו את הקובץ המתאים לחומרה ולצרכים שלכם והורידו רק אותו.

האם המודל יודע לקבל הנחיות עריכה בעברית?

המודל מאומן על אנגלית וסינית בלבד. אם תזינו הנחיות בעברית הביצועים ייפגעו או ייכשלו, ולכן צריך לתרגם את הטקסט לאנגלית לפני שליחתו למודל.

איך מריצים

כדי להשתמש בזה באמת, תצטרכו להתקין תוסף ייעודי לתוך ComfyUI שמריץ קבצי C++ וקודה בינאריים. ההורדה הכוללת שוקלת 72.6 גיגה-בייט כי היא אורזת יחד את כל שש גרסאות המשקלים, כך שכדאי להוריד ישירות רק את הווריאנט שמתאים למטרה שלכם.

מבחינת חומרה, המנוע תומך בכרטיסי אנבידיה החל מסדרות RTX 20 ומעלה ועד שרתי Blackwell ו־H100, כאשר תמיכה מקורית ב־FP4 דורשת ארכיטקטורת Blackwell. אם אין לכם כרטיס מודרני עם מספיק זיכרון וידאו או סבלנות לקנפג תוספים מקומיים, יהיה פשוט יותר לפנות ל־API מרוחק של המודל המקורי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("QuantFunc/Nunchaku-Qwen-Image-EDIT-2511")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0, שנשמר בירושה מהמודל המקורי של Qwen ומהרכיבים הנלווים. הוא מאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המשקלים בתוך מוצר, בתנאי ששומרים על הודעות זכויות היוצרים ומציינים את השינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗