GPT
Q

Qwen-Image-2512-Turbo-LoRA-2-Steps

קוד פתוח

Wuli-artapache-2.02026-01-28

  • diffusers
  • Qwen
  • distillation
  • lora
  • text-to-image

מתאם שמוריד את מודל התמונות של קוון לשני צעדי דגימה בלבד. הוא חותך את זמן ההמתנה לפריים בלי לדרוש החלפה של מודל הבסיס.

  • 2.2 GBמשקל הקבצים
  • 22,089הורדות בחודש
  • 127לייקים

מה זה

המתאם הזה נועד לפעול מעל מודל התמונות הבסיסי מסדרת קוון כדי לכווץ את תהליך ההסקה מ־40 צעדים לשני צעדים בלבד. בדרך כלל יצירת תמונה במודלים כאלה גוזלת שניות ארוכות של עיבוד, והתוסף הזה מאפשר לייצר ארבע תמונות ברזולוציית שני קיי בחמש שניות באתר המפתחים. ההבדל המרכזי מול הגרסה הקודמת של ארבעה צעדים הוא חיתוך נוסף של חצי מזמן החישוב לכל תמונה.

התוצאות שהמפתחים מציגים מראות שהמתאם שומר על רמת פירוט גבוהה בפורטרטים, טבע ופרוות בעלי חיים בהשוואה למודל המלא בריצת ארבעים צעדים. הוא עדיין מתמודד עם טקסטים ארוכים באנגלית שמופיעים בשלט או כריכת ספר, אם כי בצורה פחות חדה מהמודל האיטי. מי שצריך תגובה מיידית עבור משתמשי קצה מקבל כאן תפוקה מהירה בהרבה במחיר של אובדן קל בחדות.

מתאים ל

  • תצוגה מקדימה בזמן אמת

    יצירה מהירה של סקיצות למשתמשי קצה בתוך שניות ספורות כדי לבחור כיוון לפני עיבוד כבד.

  • מחולל תמונות אווטאר

    הפקת פורטרטים של דמויות מונפשות או ריאליסטיות בשני צעדים כדי לקצר תורים במערכת.

  • ייצור רקעים ואווירה

    יצירת נופים, טבע ותאורות מורכבות שלא דורשים שלטים וטקסט מדויק בתוך התמונה.

איפה זה נופל

היוצרים מודים במפורש שהאיכות יורדת בעיבוד טקסטים מורכבים בתוך התמונה, וממליצים להעלות את מספר צעדי ההסקה אם הטקסט מתעוות. כשמכריחים מודל לסיים תמונה בשני צעדים בלבד, הוא מפספס לעיתים אותיות קטנות או מייצר שגיאות כתיב בשלטים וכותרות ספרים. חוץ מזה, המודל אומן על אנגלית וסינית, כך שאין מה לבנות עליו להבנת הנחיות בעברית או לכתיבת אותיות בעברית בתוך התמונה עצמה. צריך גם לזכור ששני צעדים מייצרים לעיתים ארטיפקטים עדינים במרקמים עמוקים שלא רואים בריצה מלאה.

שאלות
נפוצות

האם המתאם הזה רץ לבד בלי שום קובץ נוסף?

לא. זהו מתאם לורה ששוקל 2.2 גיגה בייט ודורש טעינה של מודל הבסיס המלא של קוון. בלעדיו אין אפשרות להפיק תמונה.

האם אפשר לכתוב פרומפטים בעברית?

המתאם הוכשר לשפות אנגלית וסינית בלבד. אם תכתבו לו בעברית הוא כנראה לא יבין את הבקשה, ולכן צריך לתרגם את ההנחיות לאנגלית לפני שליחתן למודל.

איך מריצים

הקבצים שוקלים 2.2 גיגה בייט ומיועדים לטעינה מעל מודל הבסיס בספריית דיפיוזרס או במנוע דיפסנת. מכיוון שמדובר רק במשקולות לורה, צריך להחזיק בזיכרון של כרטיס המסך גם את מודל התמונות המלא עצמו, כך שכרטיס ביתי פשוט עם מעט זיכרון וידאו יתקשה להריץ את שניהם יחד.

אם אין לכם שרת ייעודי עם כרטיס מסך חזק שמחזיק את מודל הבסיס בזיכרון, פנייה לפתרון מנוהל או לשרת מרוחק תהיה פשוטה בהרבה. להרים שרת מקומי שווה רק אם יש לכם צורך לייצר עשרות אלפי תמונות ברצף או שחייבים פרטיות מלאה בלי להוציא בקשות לרשת חיצונית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wuli-art/Qwen-Image-2512-Turbo-LoRA-2-Steps")
img = pipe("a photo").images[0]

הקבצים

3 קבצים במאגר, 2.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ׳י 2.0, שמתיר שימוש מסחרי מלא, שינוי של המשקולות והפצה שלהן בתוך מוצר סגור או פתוח. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים וציון הרישיון המקורי, בלי חובת שיתוף של הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗