GPT
F

FLUX.1-Turbo-Alpha

קוד פתוח

alimama-creativeother2024-10-12

  • diffusers
  • safetensors
  • Text-to-Image
  • FLUX
  • Stable Diffusion

מתאם שמוריד את זמני הריצה של מודל התמונות לשמונה צעדים בלבד בלי לשבור את האיכות. פתרון מתאים למי שרוצה לייצר תמונות מהר על בסיס פלאקס.

  • 347Mפרמטרים
  • 678 MBמשקל הקבצים
  • 12,212הורדות בחודש
  • 642לייקים

מה זה

מדובר במתאם מסוג לורה שפותח על ידי עלימאמא, זרוע השיווק והקריאייטיב של עליבאבא, ומיועד להאצת יצירת תמונות מטקסט. הוא מבוסס על זיקוק ידע שמקצר את תהליך ההסקה מול מודל הבסיס FLUX.1-dev, כך שבמקום עשרות צעדים מייגעים מקבלים תוצאה כבר בשמונה צעדים. האימון שלו כלל מיליון תמונות ממקורות פתוחים ופנימיים בדירוג אסתטי גבוה וברזולוציה מעל 800 פיקסלים.

הייחוד הטכני כאן נעוץ באימון אדברסרי שמנצל את הטרנספורמר המקורי בתור גב של דיסקרימינטור עם מספר ראשים בכל שכבה. מעבר ליצירת תמונה ישירה, המתאם יודע להשתלב במקביל עם מודל אינפיינטינג ייעודי מאותה סדרה, בלי לסטות יותר מדי מהסגנון והתוצאות של מודל המקור.

מתאים ל

  • יצירת תמונות מהירה מטקסט

    מאפשר לייצר תמונות באיכות של פלאקס בשמונה צעדים בלבד, מה שמקצר משמעותית את זמן ההמתנה לכל פלט.

  • עריכת מקטעים בתמונה

    עובד לצד קונטרול-נט של אינפיינטינג ומאפשר לתקן אזורים ספציפיים בתמונה קיימת במהירות גבוהה.

  • בניית שרשראות עבודה בקומפי

    מגיע עם קובצי הגדרה מוכנים שמשתלבים ישירות בסביבת העבודה של קומפי יו איי לחיסכון בזמן ההגדרה.

איפה זה נופל

המתאם מוגדר כגרסת אלפא, מה שאומר שהיציבות עדיין נבדקת והצוות כבר מתכנן גרסה שתדרוש אפילו פחות צעדים. בנוסף, הוא אומן באופן קשיח על ערך guidance scale של 3.5, כך שסטייה מההגדרה הזו כנראה תפגע בתוצאה הסופית. המודל מתמקד באנגלית בלבד, ואי אפשר להריץ אותו עצמאית בלי להחזיק קודם את מודל הבסיס המלא.

שאלות
נפוצות

האם אפשר להריץ את המתאם הזה כמודל עצמאי?

לא. מדובר בקובץ לורה במשקל של כמה מאות מגה בייטים שחייב להיטען מעל מודל FLUX.1-dev המלא. אתם צריכים סביבה וחומרה שיכולות להריץ את מודל הבסיס.

איזה פרמטרים צריך להגדיר בהרצה כדי לקבל תוצאות טובות?

היוצרים ממליצים להגדיר בדיוק שמונה צעדי הסקה, guidance_scale בערך של 3.5 ומשקל לורה של 1. המודל אומן סביב הערכים האלה, ולכן שינוי שלהם עלול לייצר עיוותים בתמונה.

איך מריצים

המשקל של הקבצים קטן מאוד, 678 מגה בייט בלבד, אבל הוא לא רץ לבד. צריך לטעון את מודל הבסיס השלם של פלאקס בזיכרון של כרטיס המסך באמצעות ספריית דיפיוזרס או קומפי יו איי, ואז למזג לתוכו את המתאם. ההרצה דורשת כרטיס מסך מודרני שתומך בחישובי bfloat16 ומסוגל להחזיק מודל כבד כזה.

בקוד מגדירים שמונה צעדי הסקה, guidance scale של 3.5 ומשקל לורה של 1.0. אם אין לכם חומרה ייעודית עם מספיק זיכרון וידאו להחזיק את פלאקס המקורי, אין טעם לנסות להרים את זה מקומית, ועדיף להשתמש בשרת מרוחק.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("alimama-creative/FLUX.1-Turbo-Alpha")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כרישיון מותאם אישית שאינו מפורט במלואו בעמוד. מאחר שהוא יושב ישירות על מודל הבסיס FLUX.1-dev, הוא כפוף למגבלות של אותו מודל, ולכן לא מיועד ישירות לשימוש מסחרי חופשי בלי בדיקה משפטית קפדנית.

הרישיון המלא בעמוד המודל ↗