GPT
Q

Qwen-Image-2512

קוד פתוח

Qwenapache-2.02025-12-30

  • diffusers
  • safetensors
  • text-to-image
  • en
  • zh

יש כאן גם סקירה על Qwen עצמו.

מודל מחולל תמונות ענק של 20 מיליארד פרמטרים, שמצטיין בדיוק פוטוריאליסטי של בני אדם ושילוב טקסט מורכב. הוא פונה למי שצריך תמונות אינפוגרפיקה ודיוק אנטומי בלי לוותר על קוד פתוח.

  • 20Bפרמטרים
  • 53.7 GBמשקל הקבצים
  • 71,751הורדות בחודש
  • 947לייקים

מה זה

מדובר בעדכון דצמבר 2025 לסדרת מחוללי התמונות של Qwen, שיושב על ספריית diffusers. המודל מתמקד בשלושה תחומים: הפחתת המראה המלאכותי והחלק מדי של עור ושיער אנושי, חידוד פרטים קטנים בטבע כמו פרוות בעלי חיים ומים, ושליטה יוצאת דופן בעימוד של טקסט מורכב ואינפוגרפיקות בתוך התמונה עצמה.

במבחני עיוורים של מעל 10,000 סבבים ב־AI Arena, המפתחים טוענים שהוא לקח את המקום הראשון בין מודלי הקוד הפתוח בתחום יצירת התמונה, ואף עוקף חלק ניכר מהחלופות הסגורות. השיפור מורגש ישירות במעקב אחרי הנחיות מרובות אלמנטים, כמו פוזות גוף מדויקות וכרזות מרובות תאים.

מתאים ל

  • אינפוגרפיקה ושקפים

    יצירת שקפי מצגת מלאים עם תיבות טקסט, חצים ותרשימים שדורשים טיפוגרפיה חדה.

  • פורטרטים פוטוריאליסטיים

    הפקת דמויות אנושיות עם קמטים, נקבוביות עור ושיער מופרד שנמנעים מהמראה הפלסטי.

  • כרזות מרובות תאים

    רינדור של רשתות תמונות מורכבות, כמו לוחות זמנים יומיים, תחת שפה עיצובית אחידה.

איפה זה נופל

גודל המודל הוא המגבלה המיידית, 53.7GB של משקלים מייצרים צוואר בקבוק רציני בהורדה, באחסון ובזמני ההסקה. בנוסף, נתוני ההדרכה והדוגמאות מתמקדים באנגלית ובסינית בלבד, כך שאין שום הבטחה או עדות ליכולת לרנדר טקסט עברי תקין על גבי התמונות, סביר להניח שהוא יימרח או ייכתב הפוך.

התוצאות בכרטיס המודל מציגות בעיקר דוגמאות אידיאליות סביב דמויות אסייתיות ותבניות גרפיות בסינית, לכן חובה לבדוק את התנהגות המודל מול סגנונות מערביים או פקודות בשפות אחרות לפני שמשלבים אותו במוצר.

שאלות
נפוצות

האם המודל יצליח לייצר שלטים עם טקסט בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. כל הדוגמאות של טיפוגרפיה מורכבת מוצגות בשפות אלו, ולכן סיכוי אפסי שהוא יציג אותיות בעברית בכיוון הנכון או ללא עיוותים.

האם אפשר להריץ אותו מקומית על כרטיס מסך RTX 4090 של 24GB?

לא בגרסה הגולמית שלו ששוקלת מעל 53GB. כדי להכניס 20 מיליארד פרמטרים לכרטיס של 24GB תידרש קוונטיזציה אגרסיבית, שעדיין לא הוצגה רשמית בחומרים הללו.

איך מריצים

כדי להריץ אותו צריך להתקין את גרסת הפיתוח העדכנית של diffusers מגיטהאב ישירות. מדובר ב־20 מיליארד פרמטרים ששוקלים כ־53.7 ג׳יגה־בייט בזיכרון, כך שאי אפשר להסתדר כאן עם כרטיס ביתי פשוט. תצטרכו לפחות מעבד גרפי של שרתים כמו A100 או H100 עם 80GB VRAM, או לחלק את המשקלים על פני כמה כרטיסים במקביל.

אם אתם לא בונים סביבת ייצור שדורשת פרטיות מלאה או שליטה מוחלטת במשקלים, להחזיק תשתית ייעודית לקבצים בגודל כזה זה עסק יקר ומסורבל. במקרים כאלה עדיף לבדוק קודם את הביצועים דרך הדמו ב־Hugging Face או Qwen Chat לפני שמזמינים שרת ייעודי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Qwen/Qwen-Image-2512")
img = pipe("a photo").images[0]

הקבצים

30 קבצים במאגר, 53.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, הפצה ושילוב במערכות סגורות, ללא תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗