GPT
D

danbooru2025-metadata

קוד פתוח

trojbluemit2025-01-02

מטא-דאטה מובנה של מיליוני איורי אנימה מדנבורו, שנאסף עד אפריל 2025. הוא מיועד למי שמאמן מודלים על תגיות מפורטות ורוצה נתונים מסודרים בלי לגרד את האתר לבד.

  • 2,569הורדות בחודש
  • 38לייקים

מה זה

המאגר מכיל מיליוני רשומות המייצגות פוסטים מלוח התמונות דנבורו עד מזהה 9,158,800. המידע נאסף מה־API הציבורי החל מינואר 2025 וכולל תגיות כלליות ומערכתיות, נתוני קובץ כמו גודל ורזולוציה, זמני העלאה, וציוני משתמשים. מבנה ה־JSON הגולמי שוטח לטבלה שטוחה כך שרשימות ומילונים פנימיים מחוברים בשמות עמודות ברורים.

הקובץ כולל לינקים לכ־8.8 מיליון קבצים, בעיקר בפורמט JPG שמהווה 73.3 אחוזים ו־PNG שמהווה 25.4 אחוזים. מעבר לפרטים הטכניים, המאגר מסווג את התוכן לפי רמות צניעות, כאשר רק 29.4 אחוזים מוגדרים כבטוחים לצפייה, וכ־21 אחוזים מדורגים כתוכן למבוגרים ברמות שונות.

מתאים ל

  • אימון מודלי טקסט לתמונה

    חיבור תגיות מפורטות ומדויקות של דמויות וסגנונות לתמונות כדי לשפר התאמה סמנטית.

  • מערכות חיפוש וסיווג תמונות

    בניית אינדקס לפי עשרות תגיות מובנות לכל תמונה, כולל שם אמן, זכויות יוצרים ודמויות.

  • מחקר על מגמות בקהילות רשת

    ניתוח שינויים בהתנהגות תיוג, פופולריות של סגנונות ודפוסי הצבעה לאורך השנים.

איפה זה נופל

התגיות נוצרות על ידי הקהילה ולכן משקפות סובייקטיביות, טעויות והטיות קהילתיות. השפות במאגר הן אנגלית ויפנית בלבד, ואין כאן עברית בכלל. יש במאגר שיעור ניכר של תכנים גרפיים ומיניים, כך שחובה להפעיל סינון לפני כל שימוש במערכת פתוחה. תגיות חסומות מטעמי צנזורה נשארו מחוץ למאגר בגלל מגבלות גישה של ה־API, והסינון של תמונות שנוצרו בבינה מלאכותית אינו מושלם.

שאלות
נפוצות

האם הדאטהסט כולל את התמונות עצמן?

לא. המאגר מכיל מטא-דאטה בלבד, כולל קישורים לקבצים, רזולוציות, זמני העלאה ותגיות. אם אתם צריכים את התמונות לאימון, תצטרכו להוריד אותן בעצמכם דרך הקישורים.

האם מותר להשתמש בזה למוצר מסחרי?

קובצי המטא-דאטה עצמם זמינים תחת רישיון MIT שמאפשר שימוש מסחרי עם ייחוס. עם זאת, התמונות שמקושרות בדאטהסט שייכות ליוצרים המקוריים שלהן, ולכן אימון על המדיה עצמה דורש בדיקה מול תנאי השימוש של דנבורו.

האם יש במאגר נתונים בעברית?

אין במאגר עברית. השפות היחידות שנתמכות ומופיעות בטקסטים ובתגיות הן אנגלית ויפנית.

מה שונה בגרסה הזו לעומת גרסאות קודמות של דנבורו?

הגרסה הזו כוללת היסטוריית תגיות עקבית יותר, כיסוי טוב יותר לפוסטים ישנים, וניסיון לסנן פוסטים שנוצרו בבינה מלאכותית ולא תויגו ככאלה. בנוסף, כל המבנים הושטחו מראש לעבודה נוחה בפורמט Parquet.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון וממירים לפנדס אם צריך. הגישה חופשית לגמרי ואין צורך באישור מראש. הנתונים מחולקים ל־44 קובצי Parquet ששמורים תחת תיקיית המידע. העמודות המרכזיות לעבודה הן רשימת התגיות, הדירוג, קישור הקובץ, והרזולוציה. שימו לב שהמאגר אינו מכיל את התמונות עצמן, אלא רק את הקישורים אליהן ואת המטא-דאטה.

from datasets import load_dataset

ds = load_dataset("trojblue/danbooru2025-metadata")

הרישיון

המאגר עצמו מופץ תחת רישיון MIT, מה שמתיר שימוש מסחרי, שינוי והפצה, בכפוף למתן קרדיט. עם זאת, הרישיון חל רק על טבלת המטא-דאטה. זכויות היוצרים על התמונות עצמן נשארות בידי היוצרים שהעלו אותן, ויש לבדוק את תנאי השימוש של דנבורו לפני שמורידים קבצים או מאמנים עליהם מודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗