GPT
S

stable-diffusion-safety-checker

קוד פתוח

CompVisרישיון לא דווח2022-08-22

  • transformers
  • pytorch
  • clip
  • endpoints_compatible

בודק בטיחות מבוסס ראייה ממוחשבת שמזהה תוכן מיני ותמונות לא הולמות. מי שבונה צינור יצירת תמונות עצמאי צריך מנגנון כזה כדי לחסום פלטים בעייתיים לפני שהמשתמש רואה אותם.

  • 77טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 989,430הורדות בחודש
  • 141לייקים

מה זה

מדובר במודל סיווג תמונות שפותח כדי לזהות תוכן NSFW בפלטים של מחוללי תמונות. הוא נשען ישירות על מודל האב CLIP ViT-L/14 של OpenAI, ומשתמש בייצוגי התמונה והטקסט שלו כדי להשוות בין התמונה שנוצרה לבין הגדרות של תוכן פוגעני או מיני. המטרה שלו פשוטה, לתפוס תמונות בעייתיות ולמנוע את ההצגה שלהן ביישומים שונים.

הבסיס של CLIP מספק דיוקים סבירים במשימות סיווג כלליות, כמו 96% עד 98.4% בזיהוי מגדר לפי נתוני Fairface המצוטטים בדף, אבל הביצועים בציוות לקטגוריות רגישות מראים פערים ברורים בין קבוצות שונות. בנוסף, חלון ההקשר שלו מוגבל ל־77 טוקנים, מה שמתאים בדיוק להגדרות טקסטואליות קצרות של מושגי סיכון ולא לניתוח טקסט עמוק.

מתאים ל

  • סינון פלט ממחוללי תמונות

    חסימת תמונות NSFW מיד אחרי תהליך היצירה בשרת ולפני החזרתן למשתמש הקצה.

  • מחקר הטיות בראייה ממוחשבת

    בדיקת דיוק, יציבות והטיות סיווג על פני קבוצות אוכלוסייה שונות לפי נתוני CLIP.

  • בקרת תוכן במאגרי תמונות

    סריקה מוקדמת של קבצים חדשים כדי לוודא שאינם כוללים תוכן מיני בוטה.

איפה זה נופל

בכרטיס מודגש שהמודל סוחב איתו את כל ההטיות המובנות של CLIP. בבדיקות של המפתחים התגלו פערים משמעותיים בסיווג לפי גזע ומגדר, וסכנה להדבקת תוויות פוגעניות או השוואה לקטגוריות לא אנושיות. דיוק סיווג הגיל שלו עומד על כ־63% בלבד. אסור להסתמך עליו כמסנן מוחלט, והוא עלול לחסום תמונות תמימות לחלוטין או לפספס תכנים בעייתיים בגלל תלות באופן שבו הוגדרו הקטגוריות.

שאלות
נפוצות

האם המודל יודע לזהות כל סוג של תוכן אלים או מסוכן?

לא. המודל מתמקד בזיהוי תוכן NSFW ולא מהווה פתרון כולל לאלימות, שנאה או סיכונים אחרים. מעבר לכך, ההטיות המובנות של ארכיטקטורת CLIP גורמות לפספוסים ולחוסר אחידות לפי מאפייני הדמויות בתמונה.

איך משלבים אותו בקוד קיים?

הכרטיס מדגים טעינה בעזרת AutoProcessor ו־SafetyChecker מתוך transformers, אך ממליץ להשתמש בו ישירות כחלק מצינור העבודה של ספריית diffusers. הוא מקבל את התמונה המעובדת ומחזיר חיווי האם התוכן זוהה כבעייתי.

איך מריצים

המודל שוקל 1.1 ג'יגה בייט בחמישה קבצים, והוא מוגדר בדיוק של float32. המשמעות היא שאין פה דרישת חומרה כבדה במיוחד, וכל כרטיס מסך בסיסי או מעבד מודרני בשרת ענן יריצו אותו בלי בעיה לצד המודל הראשי שמייצר את התמונות. ההרצה נעשית דרך ספריית transformers או diffusers עם מעבד התמונות והמודל הייעודי.

בכרטיס מצוין במפורש שהוא מיועד לעבודה עם diffusers ולא ישירות עם transformers לבדם. אם אתם מריצים פייפליין מקומי של יצירת תמונות, הגיוני להחזיק אותו באותו תהליך כדי לחסוך זמני רשת, אבל אם אתם רק בודקים מדי פעם תמונות בודדות ולא רוצים להחזיק שרת דולק, קריאה לפתרון מנוהל חיצוני תחסוך תחזוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="CompVis/stable-diffusion-safety-checker")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 1.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שילוב שלו במוצר סגור או שירות בתשלום חושף אתכם לסיכון משפטי. חברות שצריכות עמידה ברגולציה יצטרכו לבדוק את תנאי המקור של היזמים לפני הפצה.

הרישיון המלא בעמוד המודל ↗