GPT
F

flux-ip-adapter-v2

קוד פתוח

XLabs-AIapache-2.02024-10-23

  • diffusers
  • image-to-image
  • en

המתאם הזה מחבר תמונת מקור כהנחיה חזותית ליצירת תמונות חדשות. הוא פותח במיוחד כדי לשבת על מודל הבסיס של פלוקס ולשלוט בסגנון בלי אימון מחדש.

  • 1009 MBמשקל הקבצים
  • 22,213הורדות בחודש
  • 324לייקים

מה זה

מדובר במתאם שנועד להנחות יצירת תמונה באמצעות תמונה אחרת במקום להסתמך רק על טקסט באנגלית. הוא נבנה כתוסף עבור מודל הבסיס FLUX.1 dev של חברת Black Forest Labs, ושוקל כגיגה בודד המחולק בין מספר קבצים בספריית diffusers.

הצוות אימן אותו בשני שלבים מוגדרים. השלב הראשון כלל 150 אלף צעדים ברזולוציה בסיסית של 512 על 512 פיקסלים, והשלב השני הוסיף עוד 350 אלף צעדים ברזולוציה של 1024 על 1024 תוך שמירה על יחס התמונה המקורי. גרסה זו כוללת התאמה ישירה לממשקי ComfyUI באמצעות צמתים ייעודיים, לצד הרצה רגילה בקוד פייתון דרך המאגר הרשמי של היוצרים.

המתאם לא מחליף את מודל הדיפוזיה הענק עצמו אלא מתלבש עליו ומכוון את התוצאה הסופית לפי קלט הוויזואליה שסיפקתם. זה חוסך את הצורך לנסות לתאר במילים מדויקות סגנונות מורכבים, ומאפשר לקחת רפרנס קיים ולהשליך את המאפיינים שלו אל תוך תהליך היצירה של פלוקס.

מתאים ל

  • העברת סגנון מתמונה

    המודל מאפשר לקחת תמונת רפרנס ולהחיל את המראה והסגנון שלה ישירות לתוך פלוקס.

  • עבודה בתזרימי ComfyUI

    הגרסה הזו מתחברת ישירות לצמתים ייעודיים בסביבת העבודה הפופולרית.

  • שליטה מונחית תמונה

    הוא מתאים למצבים שבהם הנחיות טקסט באנגלית לא מצליחות לתפוס את הפרטים המדויקים.

איפה זה נופל

היוצרים מבהירים שהמתאם נמצא עדיין בגרסת בטא ולא מתחייב לתוצאות טובות בניסיון ראשון. לעיתים קרובות נדרשים כמה ניסיונות יצירה וכוונון ידני של עוצמת המשקל כדי להגיע לפלט שמיש ולא מעוות.

מעבר לכך, הוא דורש מודל CLIP נוסף כדי לקרוא את התמונות, מה שמוסיף עוד נקודת שבר בשרשרת ההרצה שלכם. ללא בדיקה יסודית של התנהגות המשקלים, מסוכן לשלב אותו באוטומציה עיוורת.

אותה משפחה

flux-ip-adapter יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במתאם הזה במוצר מסחרי שמוכר תמונות?

לא. למרות שבדף המודל מצוין רישיון קוד פתוח, הטקסט מבהיר במפורש שהמשקלים כפופים להסכם השימוש הלא מסחרי של FLUX.1 dev. כל שימוש מניב רווח מפר את תנאי הרישיון של המפתחים.

האם המתאם פועל באופן עצמאי ללא מודלים נוספים?

לא. מדובר במתאם בלבד שאינו מייצר תמונות לבדו. כדי לעבוד איתו אתם חייבים להריץ ברקע את מודל הבסיס FLUX.1 dev וכן להוריד מודל ראייה CLIP גדול של OpenAI לצורך עיבוד התמונה.

מה אפשר לעשות אם התוצאות יוצאות מעוותות או לא דומות למקור?

מאחר שהמודל מוגדר כבטא, היוצרים ממליצים לשחק עם ערך העוצמה של המתאם בהגדרות. לעיתים נדרשים כמה ניסיונות יצירה שונים ושינויי פרמטרים עד שמגיעים לרמת הדיוק המבוקשת.

איך מריצים

כדי להשתמש בו צריך להריץ קודם כל את מודל הבסיס הכבד FLUX.1 dev, מה שמחייב כרטיס מסך חזק מאוד עם נפח זיכרון משמעותי לתהליכי דיפוזיה. המתאם עצמו מוסיף עוד כגיגה בייט של משקלים, אך עיקר העומס מגיע מהרצת פלוקס ומודל הראייה הנלווה.

ההטמעה דורשת הורדה של מודל CLIP נפרד של OpenAI, התקנת צמתים מותאמים אישית אם עובדים בתוך ComfyUI, או הרצה דרך הסקריפט main.py שבמאגר x-flux. אם אין לכם חומרה מקומית שמסוגלת לסחוב את פלוקס, עדיף להשתמש בתשתית ענן או שירות חיצוני במקום להשקיע ברכישת כרטיסי מסך יקרים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("XLabs-AI/flux-ip-adapter-v2")
img = pipe("a photo").images[0]

הרישיון

למרות הסימון הטכני באתר כרישיון אפאצ'י, המפתחים מבהירים בגוף הכרטיס כי המשקלים כפופים לרישיון הלא מסחרי של FLUX.1 dev. המשמעות היא שאסור להשתמש במודל הזה בתוך מוצר מסחרי, שירות בתשלום או כל פעילות עסקית מניבה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗