GPT
W

wd-swinv2-tagger-v3

קוד פתוח

SmilingWolfapache-2.02024-03-06

  • timm
  • onnx
  • safetensors

מדובר במודל ראייה ממוחשבת שמזהה דמויות, תגיות כלליות ודירוגי תוכן באיורי אנימה. אם אתם צריכים לקטלג כמויות של ארט בסגנון הזה, הוא נבנה בדיוק לזה.

  • 98Mפרמטרים
  • 1.2 GBמשקל הקבצים
  • 593,200הורדות בחודש
  • 96לייקים

מה זה

הוא מבוסס על ארכיטקטורת SwinV2 ומיועד לחלץ תגיות מאיורים בדיוק לפי הטרמינולוגיה של Danbooru. הוא מזהה שלושה דברים במקביל: תגיות כלליות שמתארות מה רואים בציור, שמות של דמויות ספציפיות, ודירוגי צניעות של התוכן. זה שימושי בעיקר למי שמכין דאטהסטים לאימון מודלי יצירת תמונה כמו Stable Diffusion ורוצה לתייג אלפי תמונות אוטומטית.

בגרסה הזו המפתח אימן את הרשת עם שקלול של תדירות התגיות כדי להתמודד עם חוסר איזון במחלקות. במבחני התיקוף התוצאה היא F1 של 0.4541 בסף שוויון בין דיוק לכיסוי של 0.2653. זה אומר שבפועל, כדי לקבל איזון שפוי בין תיוג יתר לפספוסי תגיות, צריך לחתוך בערך סביב סף ודאות נמוך מאוד של 0.26, ולא ב־0.5 הרגיל.

מתאים ל

  • תיוג דאטהסטים לאימון

    הכנת תיאורי תמונה ופרומפטים אוטומטיים לאימון LoRA או מודלי תמונה מבוססי אנימה.

  • מיון תוכן וסינון

    סיווג אוטומטי של תמונות לפי רמת החשיפה שלהן באמצעות מנגנון הדירוגים המובנה.

  • קטלוג גלריות אנימה

    זיהוי שמות דמויות ואלמנטים ויזואליים בתוך מאגרי איורים קיימים לצורך חיפוש מהיר.

איפה זה נופל

הוא אומן אך ורק על תמונות מתוך Danbooru עם מזהים עד 7220105 ועדכון תגיות עד פברואר 2024. תמונות מציאותיות, צילומים או סגנונות מערביים לא יעבדו כאן כמו שצריך. נוסף לזה, במהלך האימון סוננו החוצה תגיות שהופיעו בפחות מ־600 תמונות, ונופו יצירות עם פחות מעשר תגיות כלליות. אם יש לכם דמות נישתית מאוד או תכונה נדירה שלא מופיעה במאות איורים במאגר המקורי, הוא פשוט יתעלם ממנה.

שאלות
נפוצות

איזה סף ודאות כדאי להגדיר בקוד?

בתיעוד הרשמי מצוין שהאיזון בין דיוק לכיסוי מגיע בסף של כ־0.265. אם תגדירו סף קלאסי של 0.5 תקבלו מעט מאוד תגיות, ואם תרדו נמוך מדי תקבלו המון זיהומים שגויים.

האם אפשר לתייג איתו תמונות רגילות של אנשים?

לא מומלץ בכלל. הוא אומן לחלוטין על מאגר של אנימה ואיורים, והוא ינסה להלביש תגיות מונפשות ומוזרות על אנשים אמיתיים.

איך מריצים

עם 98 מיליון פרמטרים ומשקל קבצים כולל של 1.2 גיגהבייט, לא צריך פה מפלצת עיבוד. אפשר להריץ אותו דרך ספריית timm בפייתון או כמודל ONNX עם onnxruntime מגרסה 1.17 ומעלה, והוא יעבוד מעולה על כרטיס מסך ביתי פשוט ואפילו על מעבד רגיל אם אין עומס חריג. גרסת ה־ONNX פתוחה לעיבוד באצ'ים בלי הגבלה של תמונה בודדת בכל קריאה.

אין סיבה לשלם ל־API חיצוני על מודל כזה. הוא קטן, זול להפליא לחישוב, ומספיק קל כדי להרים אותו מקומית בתוך סקריפט עיבוד נתונים שלכם בלי להוציא שקל על שרתים כבדים.

pip install -U huggingface_hub
hf download SmilingWolf/wd-swinv2-tagger-v3

הקבצים

8 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר לעשות עם המודל כמעט הכל, כולל שילוב במוצרים מסחריים והפצה פנימית או חיצונית. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על היוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗