GPT
F

FLUX.2-klein-ghost-mannequin

קוד פתוח

nhathoangfotoapache-2.02026-02-03

  • diffusers
  • flux
  • lora
  • adapter
  • text-to-image

התאמת LoRA ממוקדת ליצירת תמונות ביגוד בתלת-ממד שנראות כאילו הולבשו על בובת ראווה שקופה. הפתרון פונה לחנויות אופנה שרוצות לוותר על צילומי סטודיו ידניים.

  • 3.7 GBמשקל הקבצים
  • 9,841הורדות בחודש
  • 38לייקים

מה זה

מדובר במשקולות LoRA שמתלבשות על מודל הבסיס FLUX.2 בגרסת 9B. המטרה כאן מאוד צרה ומוגדרת, ייצור אפקט של בובת רפאים עבור צילומי מוצר של בגדים. במקום להציג חולצה שמונחת שטוח על שולחן או לשלם לצלם שיערוך החוצה בובת פלסטיק, המודל מייצר את הבגד כאילו אדם בלתי נראה לובש אותו, כולל החללים הפנימיים בצווארון ובשרוולים.

האימון נעשה ברמת Rank 256 גבוהה יחסית לאורך 6,000 צעדים, מה שמסביר למה קובץ ה־LoRA עצמו שוקל 3.7 גיגה-בייט. הדרגה הגבוהה נועדה לשמר פרטים קטנים כמו מרקם הבד, תפרים ודיוק בצבעים, שנוטים להימרח באימונים קלים יותר. אין פה מבחני ביצועים מספריים עצמאיים, אבל הדגש המוצהר הוא על מראה מסחרי חד שלא מקבל את התחושה הפלסטיקית המוכרת של יצירת תמונות כללית.

מתאים ל

  • יצירת קטלוג אופנה

    ייצור מהיר של תמונות ביגוד בתלת-ממד שנראות כאילו הן נלבשות על גוף, ישירות לרקע לבן חלק.

  • החלפת צילומי פקשוט

    חסכון בעריכה גרפית ידנית שמוחקת בובות ראווה אמיתיות מצילומי סטודיו קיימים.

  • הדמיות לקולקציות חדשות

    בדיקת המראה של גזרות שונות על גוף בלתי נראה לפני שמתחילים תפירה וייצור בפועל.

איפה זה נופל

האימון התבסס על 50 זוגות תמונות בלבד. זה מאגר קטן מאוד, כך שיש סיכון ממשי ללמידת יתר על סגנונות ספציפיים וקושי להתמודד עם בגדים בגזרות מוזרות, בדים שקופים או הדפסים מורכבים. בנוסף, משקל הקובץ חריג בגודלו לתוסף LoRA ומאט את הטעינה. חייבים לבדוק אותו על מגוון של מוצרים אמיתיים לפני שבונים עליו תהליך אוטומטי לאתר מכירות, כי כרטיס המודל לא מציג נתוני כשל או מדדי איכות אובייקטיביים.

שאלות
נפוצות

למה קובץ ה־LoRA הזה כל כך כבד ביחס לתוספים אחרים?

האימון נעשה ב־Rank 256, רמה גבוהה בהרבה מהמקובל בתוספים פשוטים. זה מאפשר לשמור על טקסטורות עדינות של בדים, אבל מייצר קבצים בנפח של כמעט ארבעה גיגה-בייט שמכבידים על האחסון והטעינה לזיכרון.

האם אפשר להשתמש בו ישירות בלי מודל אחר?

לא. מדובר במשקולות LoRA בלבד ולא במודל עצמאי מלא. חייבים לטעון מודל בסיס מתאים ממשפחת FLUX.2 klein 9B ולהרכיב עליו את המתאם הזה יחד עם מילת ההפעלה הייעודית.

איך מריצים

כדי להריץ את זה צריך קודם כל לטעון את מודל הבסיס של תשעה מיליארד פרמטרים דרך ספריית diffusers או בתוך ComfyUI, ואז להלביש עליו את מתאם ה־LoRA במשקל שנע בין 0.8 ל־1.0. זה דורש מעבד גרפי עם מספיק זיכרון וידאו להרצת מודל בגודל הזה ב־bfloat16. מילת ההפעלה 3Dghostmannequin חובה בכל הנחיה.

יש שני מסלולי ריצה עיקריים לפי מודל הבסיס שבוחרים. אם עובדים עם מודל הבסיס הרגיל, צריך בין 20 ל־30 צעדים עם ערכי CFG נמוכים של 2.0 עד 4.0. אם מחברים את המתאם למודל מזוקק ומהיר, אפשר לרדת לארבעה צעדים בלבד עם CFG קבוע של 1.0. כשמדובר בייצור אלפי תמונות לקטלוג, מודל מזוקק יחסוך שעות חישוב יקרות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("nhathoangfoto/FLUX.2-klein-ghost-mannequin")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או שירותים בתשלום. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על היוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗