GPT
Q

Qwen-Image

קוד פתוח

Qwenapache-2.02025-08-02

  • diffusers
  • safetensors
  • text-to-image
  • en
  • zh

יש כאן גם סקירה על Qwen עצמו.

מודל פתוח שמייצר תמונות ומטפל ברינדור טקסט מדויק באנגלית ובסינית לצד עריכה חזותית מורכבת. מי שמחפש שליטה בטיפוגרפיה, פוזות ושינוי אלמנטים ימצא בו יכולות מעבר ליצירה בסיסית.

  • 20Bפרמטרים
  • 53.7 GBמשקל הקבצים
  • 313,794הורדות בחודש
  • 2,625לייקים

מה זה

מדובר במודל של עשרים מיליארד פרמטרים שמיועד ליצירת תמונות מטקסט, עם דגש על שילוב טיפוגרפיה בתוך התמונה עצמה. במקום למרוח אותיות עקומות כמו שקורה לעיתים קרובות, הוא יודע לשמור על פונטים, מבנה ויישור מדויק באנגלית ובסינית ישירות מתוך ההנחיה.

חוץ מיצירה של סגנונות מגוונים כמו אנימה, ריאליזם וציור, הוא כולל יכולות עריכה נרחבות. הוא מטפל במחיקה והוספה של אובייקטים, העברת סגנון, שינוי טקסט בתוך תמונה קיימת, שינוי תנוחות גוף של אנשים, הערכת עומק, זיהוי אובייקטים ורזולוציית על שמבוססים על הבנה חזותית.

מתאים ל

  • רינדור כרזות באנגלית

    יצירת עיצובים שדורשים שילוב מדויק וקריא של אותיות ומילים כחלק מהתמונה עצמה.

  • עריכת תמונות מורכבת

    מחיקת פרטים, שינוי טקסט קיים בתוך פריים ושינוי תנוחות של דמויות בצורה מבוקרת.

  • הערכת עומק ומקטעים

    חילוץ מפות עומק, זוויות חדשות וזיהוי אובייקטים לצורכי עיבוד ויזואלי מתקדם.

איפה זה נופל

המודל תומך לפי התיעוד רק בשפות אנגלית וסינית. מי שבונה על רינדור טקסט בעברית או הבנת הנחיות בעברית יגלה מהר מאוד שזה לא נתמך ולא יעבוד בצורה סבירה. בנוסף, מודל כבד כזה מייצר זמני תגובה ארוכים יחסית ומחייב משאבי מחשוב עצומים שמקשים על יישומים בזמן אמת.

שאלות
נפוצות

האם המודל יודע לייצר טקסט בעברית על גבי התמונה?

לא. התיעוד הרשמי מציין במפורש תמיכה בשפות אנגלית וסינית בלבד. כל ניסיון לבקש שלטים או טיפוגרפיה בעברית יוביל לתוצאות משובשות ולא שמישות.

אפשר להריץ אותו על מחשב אישי רגיל?

לא מומלץ לנסות בלי כרטיס מסך מקצועי עם נפח זיכרון עצום. המודל מורכב מעשרים מיליארד פרמטרים ומשקלו 53.7 גיגהבייט, כך שהוא דורש חומרת שרתים כבדה כדי להיטען ולעבוד.

איך מריצים

כדי להריץ אותו צריך להתקין את גרסת הפיתוח העדכנית של diffusers ישירות ממאגר הגיטהאב. קבצי המודל שוקלים 53.7 גיגהבייט ומחולקים ל־31 קבצים שונים, מה שאומר שצריך כרטיסי מסך חזקים מאוד עם זיכרון וידאו גדול במיוחד כדי לטעון אותו לוקאלית.

מי שאין לו תשתית שרתים ייעודית עם חומרה ברמה הזו יתקשה מאוד להרים אותו לבד. בפרויקטים שצריכים רק בדיקות או עבודה נקודתית, שימוש ב־API חיצוני או בדמו במקום החזקת שרת פרטי יחסוך את כאב הראש התפעולי והעלויות הכבדות של החומרה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Qwen/Qwen-Image")
img = pipe("a photo").images[0]

הקבצים

31 קבצים במאגר, 53.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה שלהם בתוך מוצרים. התנאי העיקרי הוא שימור הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗