GPT
F

FLUX.1-dev-IP-Adapter

קוד פתוח

InstantXother2024-08-14

  • diffusers
  • Text-to-Image
  • IP-Adapter
  • Flux.1-dev
  • image-generation

מתאם תמונה שמתלבש על מודל הבסיס כדי להזין לו תמונת רפרנס לצד הטקסט. אתם מקבלים הנחיה ויזואלית ישירה בלי לאמן מודל מאפס על כל סגנון חדש.

  • 5.0 GBמשקל הקבצים
  • 10,184הורדות בחודש
  • 326לייקים

מה זה

מדובר במתאם שמזריק מידע מתמונה לתוך שלושים ושמונה שכבות יחידות ותשע עשרה שכבות כפולות של מודל הבסיס. הצוות השתמש במקודד התמונה של גוגל, siglip-so400m-patch14-384, שממיר את התמונה למאה עשרים ושמונה תווים ויזואליים דרך שתי שכבות לינאריות בלבד. האימון נעשה על דאטה-סט פתוח של עשרה מיליון פריטים לאורך שמונים אלף צעדים.

בפועל, הוא מאפשר למודל להתייחס לתמונה כקלט מקביל לפרומפט טקסטואלי רגיל באנגלית. זה פותר את הצורך לתאר במילים כל פרט קומפוזיציה או אווירה, אבל דורש מכם לקחת בחשבון שהתמונה עלולה להפריע לטקסט או לא להגיב אליו בעוצמה שציפיתם.

מתאים ל

  • הנחיה ויזואלית מהירה

    שילוב קומפוזיציה מתמונה קיימת בתוך פרומפט טקסטואלי באנגלית בלי לאמן משקלים ייעודיים.

  • בדיקות קונספט מקומיות

    ניסוי מהיר ב־ComfyUI לבחינת התנהגות רפרנסים לפני שמשקיעים באימון מודל מותאם אישית.

  • שילוב עם שכבות LoRA

    חיבור תמונת בסיס לתוספי אימון קיימים כדי לקבל כיוון ויזואלי נוסף ליצירה.

איפה זה נופל

המתאם לא מיועד לשמירה מדויקת על עקביות של דמויות וגם לא להעברת סגנון מוקפדת. היוצרים מודים שיש כאן פשרה מובנית בין זליגת תוכן לבין סגנון, ושהמעבר לארכיטקטורת DiT לא מציג את אותן תכונות הפרדה שהיו מוכרות במודלים מבוססי UNet. בנוסף, יש למודל בעיית מגוון שמקשה עליו לקלוט סגנונות ומושגים מסוימים, ולרוב תצטרכו כמה ניסיונות עד שתצא תוצאה סבירה.

שאלות
נפוצות

אפשר להשתמש במודל הזה כדי לייצר אותה דמות בדיוק בכמה תמונות שונות?

לא, הכרטיס מציין במפורש שהוא לא נועד לעקביות מדויקת של דמויות. תקבלו דמיון כללי מסוים, אבל יהיו סטיות משמעותיות בתווי הפנים ובפרטים בין ריצה לריצה.

למה התמונה שיצאה מתעלמת לגמרי מחלק מהמילים בפרומפט?

המתאם גורם לתמונה להתנהג כמו טקסט בתוך הרשת, ובחלק מהמקרים המידע הוויזואלי משתלט ומפריע לטקסט הרגיל. תצטרכו לשחק עם הניסוח ולהריץ כמה פעמים כדי למצוא איזון.

איך מריצים

המשקל של הקבצים עומד על 5.0 גיגה-בייט, אבל הוא לא רץ לבד. צריך לטעון אותו מעל מודל הבסיס השלם, מה שדורש כרטיס מסך חזק מאוד עם נפח זיכרון וידאו משמעותי, או חלוקה מורכבת של משאבים.

הקוד עדיין לא נכנס רשמית לספריית diffusers הסטנדרטית, אז תצטרכו להשתמש בקבצים המקומיים של הפרויקט או בהרחבה ייעודית ל־ComfyUI. אם אין לכם שרת מקומי חזק או סבלנות להגדרות סביבה ידניות, יש אפשרות להריץ אותו דרך הממשק של Shakker AI.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("InstantX/FLUX.1-dev-IP-Adapter")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר תחת תנאי השימוש הלא-מסחריים של מודל הבסיס dev. זה אומר שאסור לשלב אותו בשום מוצר מסחרי, שירות בתשלום או הפקה שמייצרת הכנסה, אלא רק לצרכי מחקר, בדיקות וניסויים אישיים.

הרישיון המלא בעמוד המודל ↗