GPT
F

FLUX.2-klein-4B

קוד פתוח

black-forest-labsapache-2.02026-01-14

  • diffusers
  • safetensors
  • text-to-image
  • image-editing
  • flux

מודל תמונה קומפקטי שמייצר ועורך תמונות בפחות משנייה ומבוסס על ארכיטקטורת flow transformer. הוא מיועד למי שחייב מהירות תגובה אינטראקטיבית ורישיון קוד פתוח אמיתי בלי לשבור את התקציב.

  • 3.9Bפרמטרים
  • 22.1 GBמשקל הקבצים
  • 551,415הורדות בחודש
  • 917לייקים

מה זה

מדובר במודל מזוקק של כארבעה מיליארד פרמטרים שפותח כדי לתת פתרון ישיר לבעיית זמני היצירה הארוכים. הוא מאחד תחת קורת גג אחת יצירה מטקסט ועריכה שמסתמכת על כמה תמונות מקור במקביל, בלי לפצל את המשימות בין מודלים שונים. הדגש פה הוא על עבודה אינטראקטיבית, כשהיוצרים מצהירים על ריצה מלאה שלוקחת פחות משנייה אחת.

ההבדל המשמעותי מול משפחות מודלים כבדות יותר נעוץ במיקוד של הארכיטקטורה. במקום לגרור זמני פריקה של עשרות שניות, הזיקוק של הטרנספורמר מאפשר לו לרוץ בארבעה צעדי דגימה בלבד בלי לאבד את היכולת לעבד פרומפטים מורכבים. הוא מתאים למוצרים שצריכים פידבק חי ולא יכולים להרשות לעצמם להמתין לעיבוד ארוך.

מתאים ל

  • עריכת תמונה אינטראקטיבית

    זמן התגובה הקצר מאפשר למשתמש לשנות אלמנטים על בסיס תמונות מקור כמעט בזמן אמת.

  • מחולל תמונות במוצרי קצה

    נפח של 13 גיגה זיכרון גרפי מתאים להתקנה על שרתי פיתוח קלים או מחשבי עבודה חזקים.

  • יצירה ישירה מתוך ממשק

    ריצה בארבעה צעדים בלבד מונעת מהמשתמש להמתין דקות ארוכות לכל גרסה של התמונה.

איפה זה נופל

המודל מתקשה להציג עובדות אמיתיות ויכול לייצר טעויות או סילופים גלויים כשמבקשים ממנו לכתוב טקסט בתוך התמונה עצמה. כמו בכל מודל סטטיסטי, קיימת הטיה שמגיעה ישירות מנתוני האימון, וההיצמדות להוראות רגישה מאוד לניסוח של הפרומפט. כשהניסוח לא מדויק, הוא עלול להתעלם לחלוטין מחלק מהבקשות. בנוסף, הוא אומן עם מגבלות בטיחות הדוקות וסינון תכנים, כך שהוא לא יתאים לפרויקטים שדורשים חופש מוחלט ביצירת דמויות או תוכן רגיש.

אותה משפחה

FLUX.2-klein יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ישן עם 8 גיגה זיכרון?

לא, המודל דורש סביב 13 גיגה זיכרון גרפי פנוי אפילו עם טכניקות של פריקת משקלים למעבד. כרטיסים ישנים יותר פשוט יקרסו מחוסר זיכרון בזמן הטעינה.

האם הוא מסוגל לכתוב שלטים וטקסט בתוך התמונה בלי שגיאות?

לא תמיד. למרות שהוא מסוגל לייצר אותיות, התיעוד מבהיר שהטקסט עלול לצאת מעוות או עם שגיאות כתיב, במיוחד אם הפרומפט מורכב.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך עם לפחות 13 גיגה זיכרון וידאו, מה ששם אותו בטווח של כרטיסים ביתיים מודרניים כמו RTX 3090 או RTX 4070 ומעלה. ספריות כמו Diffusers ו־ComfyUI כבר תומכות בו ישר מהקופסה, והקוד הרשמי משתמש בטעינת bfloat16 עם אפשרות לפרוק חלק מהמשקלים לזיכרון המערכת כדי להקל על הזיכרון הגרפי.

אם יש לכם מחשב עם פחות מזה, או שאתם בונים שירות שצריך לעמוד בעומסי תנועה משתנים בלי לתחזק שרתים יקרים, עדיף להשתמש בנקודת הקצה של החברה בענן. הקבצים שוקלים מעל עשרים ואחד גיגה, כך שגם תהליך ההורדה הראשוני ידרוש מעט סבלנות בדיסק.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("black-forest-labs/FLUX.2-klein-4B")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 מלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו בתוך מוצרים סגורים ולהפיץ אותו חופשי, כל עוד שומרים על הודעת הרישיון המקורית ולא משתמשים בסימני המסחר של החברה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗