GPT
F

Flux-Dev2Pro

קוד פתוח

ashen0209רישיון לא דווח2024-08-23

  • diffusers
  • safetensors
  • text-to-image

הפיתוח הזה מנסה לשחזר את היכולות של Flux Pro מתוך גרסת ה־Dev הפתוחה. המטרה העיקרית שלו היא לשמש בסיס יציב יותר לאימון מתאמי LoRA בלי לשבור את המודל בדרך.

  • 12Bפרמטרים
  • 22.2 GBמשקל הקבצים
  • 606הורדות בחודש
  • 194לייקים

מה זה

מדובר בכוונון עדין של רכיב הטרנספורמר מתוך Flux-Dev, שנועד לפתור בעיה מוכרת באימון LoRA על המודל הזה. לפי היוצר, אימון מתאמים ישירות על Dev סובל מסטייה מתהליך האימון המקורי כי חסר בו תהליך הזיכוך, מה שמוביל לעיתים קרובות לתוצאות ירודות בתמונות הסופיות.

כדי לעקוף את זה, המודל אומן מחדש במשך שני אפוקים על מאגר של שלושה מיליון תמונות באיכות גבוהה. הרעיון הוא לקרב את המשקולות חזרה להתנהגות של גרסת ה־Pro המסחרית, כך שתוכלו לאמן עליו LoRA ואז להלביש את התוצאה בחזרה על Flux-Dev, בדומה לאופן שבו מאמנים על SDXL ומריצים על גרסאות טורבו.

מתאים ל

  • אימון LoRA מדויק

    משמש כבסיס לחילוץ מתאמים יציבים שאמורים לעבוד טוב יותר כשמלבישים אותם בחזרה על Flux-Dev.

  • עקיפת בעיות זיכוך

    מתאים למי שנתקל בירידה חדה באיכות התוצרים כשניסה לאמן מתאמים ישירות על מודל Dev הרגיל.

  • מחקר והשוואת משקולות

    נועד לחוקרים שרוצים לבדוק איך אימון נוסף על שלושה מיליון תמונות משפיע על התנהגות הטרנספורמר.

איפה זה נופל

המודל הזה לא נועד להחליף את מחולל התמונות היומיומי שלכם, אלא לשמש תחנת ביניים לאימון בלבד. אם תייצרו איתו תמונות ישירות כנראה שלא תקבלו שום יתרון מורגש על פני Dev הרגיל. בנוסף, כל הטענה לגבי שחזור של Flux Pro והשיפור באיכות ה־LoRA נשענת על פוסט בבלוג של המפתח בלי מדדים כמותיים רשמיים, כך שתצטרכו לבדוק בעצמכם אם האימון הנוסף על שלושת מיליון התמונות באמת מייצר תוצאות עדיפות על הדאטה-סט שלכם.

שאלות
נפוצות

האם המודל הזה מיועד ליצירת תמונות שוטפת מתוך טקסט?

לא, המטרה המוצהרת שלו היא אימון מתאמים ולא יצירה ישירה. את ה־LoRA שאימנתם עליו אתם אמורים ליישם בחזרה על גבי Flux-Dev כדי לקבל את התוצאות הרצויות.

האם אפשר להשתמש בו במוצר מסחרי?

כרגע לא כדאי לגעת בו לפרויקטים מסחריים כי לא מוגדר לו שום רישיון. מעבר לכך, מודל המקור Flux-Dev כולל מגבלות מסחריות משל עצמו, מה שמסבך עוד יותר את התמונה.

איך מריצים

טוענים את המשקולות ישירות דרך ספריית diffusers באמצעות המחלקה FluxTransformer2DModel בדיוק של bfloat16. הקבצים שוקלים קצת יותר מ־22 גיגה-בייט, כך שתצטרכו כרטיס מסך חזק מאוד עם לפחות 24 גיגה זיכרון וידאו רק כדי להחזיק את המודל עצמו בזיכרון, ועוד הרבה יותר מזה אם אתם מתכננים לאמן עליו בפועל.

אם אין לכם חומרה ייעודית לאימונים כבדים או גישה לשרת ענן מתאים, אין לכם מה לחפש כאן בהרצה מקומית. עדיף בהרבה להשתמש ב־API קיים שמספק אימונים מנוהלים או להישאר עם הגרסאות הרגילות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("ashen0209/Flux-Dev2Pro")
img = pipe("a photo").images[0]

הרישיון

היוצר לא פרסם רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם היתר ברור להשתמש במשקולות האלה, בטח שלא במוצר מסחרי. כל שימוש בו לפיתוח או לאימון מתאמים מסחריים מציב אתכם בסיכון של הפרת זכויות יוצרים, ומומלץ להימנע ממנו עד שהסטטוס יובהר.

הרישיון המלא בעמוד המודל ↗