GPT
L

LibreFLUX

קוד פתוח

jimmycarterapache-2.02024-10-20

  • diffusers
  • safetensors
  • text-to-image
  • endpoints_compatible

גרסה חופשית שעברה ביטול זיקוק מתוך FLUX.1-schnell ומחזירה תמיכה בהנחיה שלילית. היא מיועדת בעיקר למי שרוצה לאמן מודל בסיס פתוח ברישיון מתירני בלי המגבלות של הגרסאות המסחריות.

  • 12Bפרמטרים
  • 53.6 GBמשקל הקבצים
  • 96הורדות בחודש
  • 173לייקים

מה זה

היוצר לקח את מודל הבסיס המזוקק והחזיר אותו לאימון בשיטת flow-matching עם שגיאת MSE רגילה, מה שמאפשר להשתמש שוב ב־Classifier-Free Guidance ולהזין פרומפטים שליליים. המהלך הזה מחק את רוב הכוונון האסתטי וה־DPO שהוטמעו במקור, כך שהתמונות הגולמיות נראות פחות מלוטשות, אך שומרות על מגוון סגנוני רחב יותר.

בנוסף, שוחזר אורך ההקשר המלא של מקודד הטקסט T5 עד 512 טוקנים באמצעות מסיכות תשומת לב, במקום 256 הטוקנים המרופדים של schnell שגרמו לפגיעה בפרומפטים ארוכים. המודל אומן על כחצי מיליון תמונות ללא סינון אסתטי תוך שימוש בכ־1,500 שעות H100, במטרה לייצר נקודת פתיחה ניטרלית יותר לאימונים מותאמים אישית.

מתאים ל

  • אימון LoRA מסחרי

    בסיס התחלתי חופשי לחלוטין שמאפשר אימון משקלים ב־SimpleTuner בלי לחשוש ממגבלות רישוי מסחריות של יוצרי FLUX.

  • פרומפטים מורכבים וארוכים

    תמיכה במסיכות תשומת לב וב־512 טוקנים מאפשרת לקלוט תיאורים מפורטים בלי איבוד מידע בגלל ריפוד טוקנים.

  • שליטה באמצעות פרומפט שלילי

    שחזור מנגנון ה־CFG מתאים למי שחייב להחריג אלמנטים או סגנונות ספציפיים בעזרת conditional ו־unconditional נפרדים.

איפה זה נופל

המודל אינו מוכן לשימוש ישיר מול לקוחות שמצפים ליופי הוויזואלי המוכר של FLUX. ביטול הזיקוק לא הושלם במלואו, ובערכי CFG מעל 4.0 התמונות מקבלות לעיתים צללים חריגים שמציפים את הפריים או טשטוש כבד. טווח ה־CFG המומלץ מוגבל ל־2.0 עד 5.0 בלבד, אלא אם מכבים אותו בצעדים הראשונים. בנוסף, מי שאינו מתכוון לאמן LoRA או LyCORIS יישאר עם מודל איטי יותר שמייצר תוצאות גולמיות ומחוספסות.

שאלות
נפוצות

למה התמונות שיוצאות נראות פחות טוב מגרסת schnell הרגילה?

הכוונון האסתטי והעדפות ה־DPO הוסרו במכוון במהלך האימון כדי להחזיר את מודל הבסיס למצב גולמי. המטרה כאן אינה יופי מיידי בפרומפט פשוט, אלא מודל נקי יותר שמתאים לקליטת אימונים חדשים בלי להילחם בסגנון המובנה.

איך מונעים מהתמונה לצאת מטושטשת או עם כתמי צללים מוזרים?

הבעיה נובעת מביטול זיקוק חלקי. צריך להחזיק את ערך ה־guidance_scale בין 2.0 ל־5.0, או להגדיר בצינור no_cfg_until_timestep=2 כדי לעקוף את ההנחיה בצעדים הראשונים שבהם המודל רגיש במיוחד לעיוותים.

האם המודל מתאים לעבודה שוטפת בתוך ComfyUI?

קיים קובץ safetensors ייעודי ל־ComfyUI, אך הממשק אינו תומך כרגע במסיכות תשומת הלב הנדרשות. הפעלתו שם תוביל לפגיעה באיכות הפלט, ולכן עדיף להריץ אותו ישירות דרך ספריית diffusers עם הקוד המותאם.

איך מריצים

המשקל הכולל מגיע ל־53.6 גיגה-בייט על פני 55 קבצים, מה שמחייב חומרה כבדה מאוד להרצה מקומית. כדי להעלות אותו בזיכרון bfloat16 בלי קוונטיזציה תצטרכו כרטיס עם לפחות 24 גיגה-בייט VRAM, ומומלץ לקוונטט ל־int8 דרך quanto כדי לייצר תמונות בלי חריגת זיכרון.

ההרצה מתבצעת דרך diffusers 0.30.3 עם צינור מותאם אישית מהמאגר, תוך הגדרת trust_remote_code=True. יש קובץ transformer_legacy יחיד ל־ComfyUI, אך הוא אינו תומך כרגע במסיכות תשומת לב ולכן יפיק איכות נמוכה יותר. יצירת תמונה דורשת כ־35 צעדים ולוקחת בערך פי שניים זמן לעומת גרסאות מזוקקות בגלל חישוב הדגימה הכפול של ה־CFG.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("jimmycarter/LibreFLUX")
img = pipe("a photo").images[0]

הקבצים

55 קבצים במאגר, 53.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים סגורים ולהפיץ עותקים חופשי, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין כאן את המגבלות המסחריות שחלות על גרסאות FLUX אחרות כמו dev.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗