GPT
T

t2i-adapter-sketch-sdxl-1.0

קוד פתוח

TencentARCapache-2.02023-09-03

  • diffusers
  • safetensors
  • art
  • t2i-adapter
  • image-to-image

מתאם זעיר של 79 מיליון פרמטרים שמכוון את SDXL לפי סקיצות ואיורי יד. הוא מוסיף שליטה מבנית כמעט בלי להכביד על הזיכרון של מודל הבסיס.

  • 79Mפרמטרים
  • 452 MBמשקל הקבצים
  • 2,698הורדות בחודש
  • 77לייקים

מה זה

מדובר ברשת התניה קלה שמתחברת ישירות למודל הבסיס של SDXL ומנחה אותו לייצר תמונות על פי קווי מתאר של סקיצה. הרעיון כאן הוא דיוק במבנה. אתם מספקים שרבוט ידני או תמונה שעברה עיבוד קצוות, והמודל משלב את ההנחיה הוויזואלית יחד עם הפרומפט הטקסטואלי.

במקום להעתיק את כל משקולות הרשת הראשית, המתאם שוקל כ־452 מגה-בייט בלבד. הוא אומן על 3 מיליון זוגות של תמונה וטקסט מתוך LAION-Aesthetics ברזולוציה גבוהה, תוך שימוש במזהה הקצוות PidiNet. זה מאפשר לקבל שליטה צורנית הדוקה על בסיס ה־2.6 מיליארד פרמטרים של SDXL, אבל בתוספת חישובית מזערית ביחס לחלופות כבדות יותר.

מתאים ל

  • המרת שרבוט לתמונה

    הפיכת סקיצות ידניות מהירות לאיורים מוגמרים ברזולוציה גבוהה תוך שמירה על הקומפוזיציה.

  • אפיון דמויות וקונספט

    שליטה במיקום המדויק של אובייקטים ודמויות בפריים לפי ציור קווי פשוט במקום ניסוח טקסטואלי ארוך.

  • יצירה חסכונית במשאבים

    הוספת יכולת שליטה מבנית ל־SDXL במערכות קיימות בלי להכפיל את דרישות זיכרון הווידאו של השרת.

איפה זה נופל

המתאם הזה אומן ספציפית על קווי מתאר בסגנון PidiNet, כלומר קווים לבנים על רקע שחור. אם תזינו לו סקיצה שלא עברה עיבוד מקדים תואם או שרבוט בעיפרון עם ניגודיות חלשה, התוצאה תתעוות או תתעלם מהקווים לחלוטין. הוא גם מוגבל לשפה האנגלית בלבד בכל הנוגע לפרומפטים הטקסטואליים, ואינו יודע לפרש הנחיות בעברית.

שאלות
נפוצות

האם אפשר להריץ את המתאם הזה לבד בלי SDXL?

לא. זה אינו מודל עצמאי ליצירת תמונות אלא מתאם הדרכה בלבד. כדי להפיק תמונה חייבים לטעון במקביל את מודל הבסיס המלא של SDXL.

איך צריך להכין את התמונה לפני שמעבירים אותה למודל?

המודל מצפה לקבל תמונה מונוכרומטית שבה קווי המתאר לבנים והרקע שחור. מומלץ להעביר את הסקיצה דרך מודל PidiNet באמצעות הספרייה controlnet_aux כפי שמופיע בקוד הדוגמה.

במה הוא שונה ממתאם ה־Canny או ה־Lineart באותה סדרה?

ההבדל העיקרי הוא בסוג חילוץ הקצוות שעליו הוא אומן. המתאם הזה מכוון לעבוד עם PidiNet שמתאים לסקיצות חופשיות ואיורי יד, בעוד מתאמי Canny מחפשים קצוות חדים וגאומטריים יותר.

איך מריצים

המודל רץ דרך ספריית diffusers באמצעות StableDiffusionXLAdapterPipeline, יחד עם חבילת controlnet_aux לצורך חילוץ קווי המתאר בעזרת PidiNet. קובץ המשקולות עצמו שוקל 452 מגה-בייט ואינו דורש משאבים חריגים בפני עצמו, אבל כדי להריץ אותו אתם חייבים לטעון את SDXL המלא ברקע. לכן בפועל צריך כרטיס מסך מודרני עם לפחות 12 עד 16 גיגה-בייט VRAM לעבודה תקינה ב־fp16.

אם אין לכם כרטיס כזה זמין בשרת מקומי, החזקת תשתית ייעודית ל־SDXL תהיה יקרה. במצב כזה עדיף להשתמש ב־API מנוהל שמתמחר לפי קריאה, במקום לשלם על מכונה חזקה שיושבת ללא שימוש.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("TencentARC/t2i-adapter-sketch-sdxl-1.0")
img = pipe("a photo").images[0]

הקבצים

5 קבצים במאגר, 452 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש. אין כאן הגבלה על הטמעה במוצר סגור או בשרתים מסחריים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗