GPT
C

controlnet_qrcode-control_v1p_sd15

קוד פתוח

DionTimmeropenrail++2023-06-15

  • diffusers
  • safetensors
  • stable-diffusion
  • controlnet
  • image-to-image

מתאם ControlNet שממזג קודי QR לתוך תמונות שנוצרות בבסיס Stable Diffusion 1.5. הוא שומר על המבנה של הקוד כדי שאפשר יהיה לסרוק אותו, בלי לוותר על הסגנון החזותי.

  • 361Mפרמטרים
  • 5.4 GBמשקל הקבצים
  • 2,336הורדות בחודש
  • 255לייקים

מה זה

מדובר במודל שמאמן רשת בקרה על גבי מודל התשתית הישן יותר של Stable Diffusion, במטרה להטמיע קודי QR ישירות בתוך היצירה. הרעיון הוא לקחת תמונת קוד מוכנה מראש, להזין אותה כקלט בקרה, ולתת למודל לצייר סביבה ועליה את הסגנון שמבקשים בפרומפט.

היוצר מציין מראש שהגרסה הזו מעט פחות יעילה מגרסת המודל שבנה עבור Stable Diffusion 2.1, אבל היא נוצרה באותו מאגר אימונים במיוחד עבור מי שעוד עובד עם המערכת הישנה יותר. במקום לנחש את הצורות, הוא מנסה לתפוס את הניגודיות הנכונה כדי שהטלפון יזהה את הקישור.

מתאים ל

  • כרזות גרפיות עם קוד סריקה

    הטמעת קישורים מעוצבים בתוך איורים להדפסה ברזולוציה של 768 פיקסלים.

  • ניסויי עיצוב ב־Automatic1111

    שילוב מהיר בתוסף הבקרה הקיים של הממשק בלי צורך במעבד מקדים מיוחד.

  • הפקת תמונות מבוססות SD 1.5

    עבודה ישירה מול תשתיות ישנות שכבר רצות אצלכם בארגון וחוסכות מעבר לגרסאות חדשות.

איפה זה נופל

המודל מודה במפורש שהוא לא מדויק במאה אחוז, ולעיתים קרובות הצורה של הקוד פשוט נבלעת בתמונה ולא ניתנת לסריקה. כדי לפתור את זה חייבים להעלות את משקל הבקרה, אבל אז הסגנון הגרפי נפגע והתוצאה נראית מאולצת, מה שהופך את העבודה איתו לניסוי וטעייה סיזיפי מול כל פרומפט בנפרד. בנוסף, הוא דורש שהקוד המקורי ייווצר עם רמת תיקון שגיאות גבוהה של 30 אחוז כדי לשרוד את התהליך.

שאלות
נפוצות

איך גורמים לקוד ה־QR להישאר סריק אחרי היצירה?

חובה לייצר מראש את הקוד ברמת תיקון שגיאות H שמספקת שרידות של 30 אחוז. בנוסף צריך לכוונן את משקל ה־ControlNet, למרות שערך גבוה מדי יהרוס את האיכות החזותית של התמונה.

עדיף להשתמש בגרסה הזו או בגרסה של 2.1?

היוצר מציין בפירוש שגרסת 2.1 יעילה מעט יותר. הגרסה הזו מיועדת רק למי שכבר כבול לסביבת עבודה או לצ'קפוינטים של Stable Diffusion 1.5 ואינו רוצה לשדרג.

האם צריך מעבד תמונה מיוחד לפני ההזנה למודל?

לא נדרש שום קדם-מעבד עבור קלט הבקרה. ניתן להשתמש רק באפשרות של היפוך צבעים אם רוצים לגוון את האופן שבו הצורות של הקוד מוטמעות ביצירה.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.4 גיגה בייט ומספר הפרמטרים הוא 361 מיליון, כך שכל כרטיס מסך מודרני שמריץ כרגע Stable Diffusion 1.5 מקומית יחזיק גם אותו בלי בעיה. מריצים אותו דרך ספריית diffusers עם תלויות כמו accelerate ו־xformers, או זורקים את קובץ ה־safetensors עם קובץ התצורה לתיקיית ControlNet בממשק כמו Automatic1111.

אין צורך במעבד מקדים ייעודי מלבד אפשרות להשתמש ב־invert לשינוי התוצאה. ההמלצה של היוצר היא לייצר תמונות ברזולוציה של 768 כדי לתת מספיק פיקסלים לפרטים הקטנים של הקוד, ולוודא שהמודל הבסיסי מתאים בדיוק לגרסה הזו כדי למנוע שגיאות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("DionTimmer/controlnet_qrcode-control_v1p_sd15")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ ברישיון openrail++, מה שאומר שמותר להשתמש בו באופן חופשי וגם מסחרי, אבל כפוף לרשימת הגבלות שימוש אתיות של משפחת רישיונות זו. אם אתם משלבים אותו במוצר או מפיצים אותו הלאה, עליכם לצרף את תנאי הרישיון ואסור להשתמש בו למטרות פוגעניות או מטעות המפורטות במסמך המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗