GPT
C

character_index

קוד פתוח

deepghsmit2024-03-07

  • not-for-all-audiences

אינדקס של 7,371 דמויות אנימה ומשחקים פופולריות עם תמונות ומאפיינים חילוציים. הוא נבנה כדי לבדוק באופן אוטומטי את יכולת ייצור הדמויות של מודלי בסיס ויזואליים.

  • 42,245הורדות בחודש
  • 23לייקים

מה זה

המאגר כולל מידע מובנה על 7,371 דמויות שמקורן במשחקים, סדרות אנימה ומותגי מדיה שונים. המפרסם אסף דמויות פופולריות מהרשת כדי לחלץ מאפיינים ותגיות ליבה עבור כל אחת מהן, במטרה לבחון מודלים של יצירת תמונות. בין המותגים הבולטים תמצאו את Kantai Collection עם 393 דמויות, פוקימון עם 380 דמויות, סדרת Fate עם 350, ו־Hololive עם 277 דמויות.

בפועל, המאגר בנוי כעץ קבצים המחולק לפי מזהים ותיקיות ספציפיות לכל דמות, דוגמת asagumo_kancolle או bushidou_sekaiju. כל תיקיית דמות מכילה תמונות בפורמט webp, ארכיון images.zip, קובץ נתונים data.json וקובץ וקטורי מאפיינים בשם feat.npy. סך הכל ישנם 45,031 קבצים במאגר.

מתאים ל

  • בחינת מודלי יצירת תמונה

    הרצת בדיקות אוטומטיות לבדיקת דיוק השחזור של דמויות אנימה ספציפיות על בסיס תגיות הליבה.

  • אימון מזהי דמויות

    שימוש בתמונות ובמאפייני feat.npy המוכנים לאימון מודלים של סיווג וזיהוי דמויות לפי תמונה.

  • בניית אינדקס חיפוש ויזואלי

    הקמת מנוע חיפוש פנימי המאפשר שליפת שמות דמויות ומקורות לפי דמיון וקטורי של תמונות קלט.

איפה זה נופל

ההטיה המשמעותית ביותר נובעת מהמיקוד בדמויות פופולריות בלבד, עם ייצוג כבד מאוד למשחקי גאצ'ה ומותגים יפניים מסוימים. מעל אלף דמויות מגיעות רק מארבעת המותגים המובילים, מה שיוצר חוסר איזון מובנה אם אתם מחפשים פיזור רחב של סגנונות. מעבר לכך, הכרטיס לא מפרט מהיכן התמונות נגרדו ברשת, איך סוננו זכויות יוצרים של היצירות עצמן, או איזה מודל הפיק את קובצי ה־feat.npy. חוסר השקיפות הזה מחייב לבדוק ידנית את איכות התיוג לפני שמסתמכים עליו כבנצ'מרק מחקרי קשיח.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

קובצי הקוד והאינדקס מוגדרים תחת רישיון MIT, שמתיר שימוש מסחרי ללא תמלוגים. יחד עם זאת, התמונות מציגות דמויות מוגנות בזכויות יוצרים כמו פוקימון ומותגי משחקים ידועים. שימוש מסחרי בתוצרים שכוללים את הדמויות עצמן עלול לחשוף אתכם לתביעות מצד בעלי המותגים.

איך נאספו הנתונים ומה כולל המאגר בפועל?

היוצר אסף תמונות של דמויות פופולריות מרחבי הרשת וחילץ מהן תגיות ומאפיינים ויזואליים. המאגר מכיל 45,031 קבצים שמחולקים לפי 7,371 דמויות שונות. כל דמות מיוצגת על ידי תיקייה ייעודית עם תמונות, ארכיון zip, קובץ נתוני json וקובץ תכונות feat.npy.

האם יש במאגר שמות או מידע בעברית?

אין במאגר עברית כלל. שמות הדמויות, המותגים והתגיות בקובצי הנתונים כתובים באנגלית בלבד או בתעתיק לטיני של שמות יפניים. אם אתם צריכים ממשק או מודל שמתקשר בעברית, תצטרכו לתרגם או למפות את המונחים בעצמכם.

מה ההבדל בין המאגר הזה למאגרי תמונות אנימה כלליים?

מרבית המאגרים ברשת מכילים אוסף תמונות גולמי עם תיוג כללי וללא מבנה אחיד לדמות. כאן המאגר מאורגן לפי ישויות של דמויות ספציפיות וכולל קובצי feat.npy מוכנים לצד תגיות ליבה. המבנה הזה נועד במיוחד כדי להקל על בדיקות השוואתיות של מודלי ייצור ולא רק להורדת תמונות.

איך טוענים

אין כאן צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך huggingface_hub או באמצעות סקריפטים שמושכים קבצים ישירות. בגלל המבנה שמחולק ל־45,031 קבצים נפרדים של תמונות webp, מערכי feat.npy וקבצי json, עדיף לא לטעון את כולו בבת אחת לזיכרון אלא לגשת נקודתית לתיקיות הדמויות שמעניינות אתכם. אם אתם מתכננים להריץ בדיקות ביצועים על מודל, הקבצים המרכזיים לעבודה יהיו קובץ ה־json שמכיל את תגיות הליבה ומערך ה־npy שמכיל את הפיצ'רים לחילוץ והשוואה.

from datasets import load_dataset

ds = load_dataset("deepghs/character_index")

הרישיון

המאגר מופץ תחת רישיון MIT, שמאפשר שימוש חופשי, שינוי והפצה, כולל שימוש מסחרי, תחת הדרישה להצמיד את הצהרת הרישיון והקרדיט למפרסם. עם זאת, הרישיון חל רק על הארגון של הדאטהסט והקוד שנלווה אליו. הדמויות והאיורים עצמם שייכים לבעלי הזכויות המקוריים של המותגים, כך שאימון מודל מסחרי עליהם דורש זהירות משפטית נפרדת לגבי זכויות יוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗