GPT
C

cafe_aesthetic

קוד פתוח

cafeaiagpl-3.02022-11-14

  • transformers
  • pytorch
  • beit
  • image-classification
  • endpoints_compatible

סיווג תמונות מהיר שנועד לסנן החוצה סקיצות, קווי ציור מלוכלכים וטקסט שמסתיר נושאים. הוא נבנה במקור לניקוי מאגרי ענק של תמונות אנימה ומציאות לפני אימון.

  • 359 MBמשקל הקבצים
  • 2,096הורדות בחודש
  • 56לייקים
  • 12שכבות

מה זה

מדובר במודל סיווג תמונה שמבוסס על Beit של מיקרוסופט עם 12 שכבות, שעבר כוונון כדי לזהות אם תמונה ראויה להיכנס לדאטה-סט או שהיא נחשבת חסרת ערך אסתטי. המטרה המקורית שלו הייתה הכנת נתונים לפרויקט Waifu Diffusion בהיקף של כ־15 מיליון תמונות, מצב שבו בדיקה אנושית אינה אפשרית.

האימון נעשה על כ־3,500 תמונות אנימה ותמונות אמיתיות. המודל מכויל מראש להיזהר מפסילת יתר, ולכן הוא מאשר כמעט הכל ומסמן כפסול רק מקרים בולטים של סקיצות, קווים לא נקיים, דפי מנגה או טקסט שחוסם את המוקד של התמונה.

מתאים ל

  • סינון מקדים למאגרי אימון

    ניקוי אוטומטי של מיליוני תמונות מסקיצות ומלל מיותר לפני שמתחילים לאמן מודלים.

  • הסרת סריקות מנגה וטקסט

    זיהוי והרחקה של דפים עם כיתובים כבדים שמסתירים את הדמויות באוספי איורים.

  • בדיקת איכות קלה לקבצים

    העפה מהירה של שרבוטים וקווים מלוכלכים מתוך תיקיות של תוכן ויזואלי.

איפה זה נופל

המודל אומן על מדגם קטן מאוד של כ־3,500 תמונות בלבד, מה שאומר שהוא לא ראה מספיק מגוון ויש לו טעויות. היוצרים עצמם מבהירים שהוא לא מושלם ומסתמכים על חוק המספרים הגדולים כדי שהשגיאות יתקזזו במאגרים של מיליוני פריטים. בנוסף, בגלל הנטייה המובנית שלו להיזהר מפסילות, תמונות באיכות בינונית או נמוכה יעברו את הסינון אם אין בהן סקיצות גסות או טקסט בולט. לא הייתי בונה עליו לבקרת איכות קפדנית של תמונות בודדות.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לדרג איכות של צילומים רגילים?

עדיף שלא. הוא אומן על שילוב של מציאות ואנימה עם דגש חזק על פסילת סקיצות, פורמט מנגה וטקסטים שמסתירים את התמונה. בצילום כללי הוא כנראה פשוט יאשר כמעט כל דבר, כי הוא מתוכנת להיזהר מפסילות.

האם הוא מתאים לסינון תמונות בזמן אמת באפליקציה?

מבחינת ביצועים הוא קל ומהיר מאוד, אבל רישיון AGPL 3.0 מחייב אתכם לשחרר את קוד השירות כולו. בנוסף, רמת הדיוק שלו מתאימה יותר לעבודה על מאגרי ענק שבהם טעויות בודדות נבלעות, ולא למוצר שבו כל תמונה צריכה החלטה מדויקת.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון בלי להסתבך. עם משקל של 359 מגה-בייט בלבד בדיוק float32, אין צורך בשרתי עיבוד כבדים וכל כרטיס מסך פשוט או מעבד סביר יריצו אותו בלי מאמץ.

בגלל המשקל הנמוך והריצה המקומית הפשוטה, אין שום סיבה לחפש שירות ענן או API חיצוני. אם אתם מעבירים ספריות של אלפי קבצים, הרצה מקומית על המחשב תהיה מהירה וזולה בהרבה מכל חלופה מרוחקת.

from transformers import pipeline

pipe = pipeline("image-classification", model="cafeai/cafe_aesthetic")
print(pipe("שלום"))

הרישיון

הרישיון הוא AGPL 3.0. מותר להשתמש בו לכל מטרה, כולל עבודה מסחרית, אבל יש כאן מלכודת משמעותית למפתחים. אם אתם משלבים את המודל בשירות רשת או במוצר שהמשתמשים ניגשים אליו, אתם מחויבים לחשוף את קוד המקור של היישום תחת אותו הרישיון בדיוק.

הרישיון המלא בעמוד המודל ↗