GPT
C

control_v1p_sdxl_qrcode_monster

קוד פתוח

monster-labsopenrail++2023-11-06

  • diffusers
  • safetensors
  • stable-diffusion
  • controlnet
  • qrcode

מודל ControlNet שממזג קודי QR ואשליות אופטיות ישירות לתוך תמונות שנוצרות בבסיס של SDXL. הוא מתאים למי שרוצה לעצב קודים סחירים שעדיין ניתנים לסריקה בטלפון.

  • 1.3Bפרמטרים
  • 4.7 GBמשקל הקבצים
  • 4,204הורדות בחודש
  • 140לייקים

מה זה

מדובר במתאם מסוג ControlNet עם 1.3 מיליארד פרמטרים, שנבנה במיוחד כדי להלביש מבנה של קוד QR על גבי מודל היצירה של SDXL דרך ספריית diffusers. במקום להדביק ריבוע שחור לבן מעל גרפיקה קיימת, הוא משלב את התבנית של הקוד כחלק מהטקסטורה והתאורה של התמונה עצמה.

היוצרים מציינים שהוא תוכנן גם ליצירת אשליות אופטיות כלליות, ולא רק לברקודים מרובעים. השליטה בתוצאה נשענת בעיקר על ה־guidance scale של המתאם, כשרמות גבוהות שומרות על קריאות הקוד ורמות נמוכות נותנות לתמונה חופש אמנותי על חשבון הסיכוי שהמצלמה תזהה אותו.

מתאים ל

  • עיצוב קודי QR שיווקיים

    שילוב קוד סריקה שמתמזג בתוך פוסטר או גרפיקה של מותג בלי להיראות כמו מדבקה מודבקת.

  • יצירת אשליות ראייה

    הטמעת דפוסים גיאומטריים סמויים בתוך תמונות נוף או חללים לפי הנחיות ה־ControlNet.

  • שיפור קריאות בתמונות קיימות

    הרצה במצב Image to Image לחיזוק קווי הקוד על תמונה שכבר נוצרה אך לא נסרקת היטב.

איפה זה נופל

הבעיה המרכזית היא שאין שום ערובה שהתוצאה תעבוד. המפתחים מודים בגלוי שלא כל קוד שייווצר יהיה קריא לסריקה, וההצלחה תלויה מאוד בניסוח הטקסט ובאיזון עדין של הפרמטרים. אם אתם בונים מוצר שחייב לספק קוד תקין במאה אחוז מהמקרים, תיאלצו לתכנת תהליך איטרטיבי שבודק סריקה אוטומטית, משתמש ב־Image to Image להצלת תמונות שבורות, או מייצר כמה גרסאות במקביל ומסנן אותן.

שאלות
נפוצות

האם כל קוד שיוצא מהמודל נסרק בהצלחה?

לא. המפתחים מציינים במפורש שחלק מהתוצאות לא ניתנות לקריאה. כדי להגדיל את הסיכוי, צריך להעלות את רמת תיקון השגיאות של הקוד המקורי, להשתמש ברקע אפור, ולהעלות את ערך ההנחיה של המתאם.

איך מחלצים קוד שלא נסרק אחרי היצירה?

הכרטיס מציע להעביר את התמונה שנוצרה לתהליך של Image to Image. שם מעלים את ערך ההנחיה למקסימום, מורידים את עוצמת ה־denoising למינימום, ומעלים אותה בהדרגה עד שהסריקה עובדת.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.7 גיגה בייט, וזה רק המתאם עצמו, לפני שחישבתם את מודל ה־SDXL הבסיסי שחייב לרוץ ברקע. כדי לטעון את שניהם יחד בספריית diffusers תצטרכו כרטיס מסך חזק עם זיכרון וידאו נדיב, במיוחד אם אתם מייצרים תמונות ברזולוציה המקורית של המודל.

היוצרים מכוונים לעבודה עם תמונת התניה שבה כל מודול בקוד הוא בדיוק 16 פיקסלים, על רקע אפור. אם אין לכם חומרה ייעודית מקומית שיכולה להחזיק מודל SDXL יחד עם מתאם כבד, עדיף להריץ את התהליך דרך שרת מרוחק או ספק ענן לפי שימוש.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("monster-labs/control_v1p_sdxl_qrcode_monster")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ ברישיון openrail++. הוא מתיר שימוש מסחרי, אבל כפוף למגבלות השימוש המקובלות של משפחת רישיונות זו, שאוסרות שימוש פוגעני או מטעה, ומחייבות להעביר את אותם תנאי רישיון הלאה אם אתם מפיצים את המשקלים או שירות שמבוסס עליהם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗