GPT
S

SD3.5-Large-IP-Adapter

קוד פתוח

InstantXother2024-11-07

  • diffusers
  • Text-to-Image
  • IP-Adapter
  • StableDiffusion3Pipeline
  • image-generation

מתאם תמונה שמתחבר ישירות למודל SD3.5 Large ומאפשר להזין לו תמונת רפרנס במקום תיאור מילולי בלבד. הוא שוקל ג'יגה וחצי וחוסך אימון מלא כשצריך לשמור על סגנון ויזואלי.

  • 1.5 GBמשקל הקבצים
  • 2,786הורדות בחודש
  • 118לייקים

מה זה

מדובר בתוסף מסוג IP Adapter שמיועד לעבוד יחד עם מודל הבסיס SD3.5 Large. הרעיון פשוט: במקום לתאר במילים את הסגנון או האובייקט שרוצים לייצר, מזינים תמונה, והמתאם מתרגם אותה לייצוג שהמודל מבין בדיוק כמו טקסט רגיל. צוות InstantX בנה אותו עם שכבות חדשות בכל 38 הבלוקים של המודל המקורי, והשתמש ב SigLIP של גוגל כדי לקודד את תמונת הקלט בצורה חדה ומדויקת יותר, עם הקצאה של 64 טוקנים לתמונה.

בפועל, המשקל של הקבצים קטן יחסית, 1.5 גיגה בייט בלבד, אבל הוא לא עובד עצמאית אלא מתלבש על מודל ענק וכבד. היתרון שלו הוא היכולת לחבר תמונת מקור לתהליך היצירה של SD3.5 בלי לשנות את המשקולות המקוריות, מה שנותן כיוון חזותי חזק לתהליך הג'נרוט באנגלית.

מתאים ל

  • שמירה על סגנון ויזואלי

    העברת שפה גרפית מתמונת מקור אחת ליצירות חדשות על בסיס SD3.5 בלי לאמן LoRA מאפס.

  • עבודה בתזרימי ComfyUI

    הוספת בקרת תמונה ישירה לתוך פייפליין קיים באמצעות הצומת הייעודי שפותח עבורו.

  • החלפת תיאורי טקסט מסובכים

    הזנת תמונה מורכבת שקשה להסביר במילים באנגלית כדי לכוון את התוצאה הסופית.

איפה זה נופל

המפתחים מודים בגלוי בבעיה מהותית: התמונה מתנהגת בדיוק כמו טקסט, ולכן המודל עלול לא להגיב אליה טוב או לייצר התנגשויות והפרעות מול הפרומפט המילולי שכתבתם. בנוסף, הקוד עדיין לא חלק מספריית diffusers הרשמית ומחייב שימוש בקבצים מקומיים או בצומת קהילתי ב ComfyUI. אם אתם צריכים שליטה מוחלטת בהפרדה שבין הפרומפט לתמונה, צפו להרבה ניסוי וטעייה.

שאלות
נפוצות

האם המתאם הזה רץ לבד בלי מודל נוסף?

לא. מדובר בתוסף ששוקל 1.5 גיגה בייט ומתחבר ישירות למודל הבסיס SD3.5 Large. אתם חייבים לטעון גם את מודל הבסיס וגם את אנקודר התמונות SigLIP של גוגל כדי שהוא יעבוד.

אפשר פשוט לייבא אותו דרך diffusers כרגיל?

עדיין לא. המפתחים מציינים שהקוד טרם הוטמע רשמית בספרייה, ולכן צריך להשתמש בקבצים המקומיים מהמאגר שלהם או בפרויקט הקהילתי שפותח עבור ComfyUI.

איך מריצים

כדי להריץ אותו צריך קודם כל חומרה שמחזיקה את מודל הבסיס SD3.5 Large, מה שאומר כרטיס מסך חזק עם זיכרון וידאו משמעותי, ולא לפטופ ממוצע. המתאם עצמו מוסיף עוד משקל קל אבל דורש גם את אנקודר התמונה SigLIP של גוגל ברקע.

הקוד עדיין לא שולב ישירות בתוך diffusers הרשמי, כך שצריך למשוך את הקבצים המקומיים מהמאגר או להשתמש בתוסף ComfyUI ייעודי של הקהילה. אם אין לכם שרת עם GPU ייעודי פנוי, פתרון ענן שמריץ ComfyUI או API מנוהל יהיה פשוט בהרבה מהתעסקות בסקריפטים המקומיים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("InstantX/SD3.5-Large-IP-Adapter")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר תחת stabilityai community license של מודל הבסיס SD3.5 Large. מותר להשתמש בו למחקר ויצירה, אבל שימוש מסחרי במוצר כפוף למגבלות של סטאביליטי, כולל תקרות הכנסה שמעבר להן תצטרכו לשלם להם על רישיון ארגוני.

הרישיון המלא בעמוד המודל ↗