GPT
D

danbooru2023

קוד פתוח

nyanko7mit2024-01-04

מאגר ענק של מעל חמישה מיליון איורי אנימה עם תיוג קהילתי עמוק. מתאים למי שמאמן מודלי יצירה או סיווג ומחפש ממוצע של שלושים תגיות מדויקות לכל תמונה.

  • 6,950הורדות בחודש
  • 293לייקים

מה זה

הנתונים מבוססים על אתר שיתוף התמונות Danbooru וממשיכים את פרויקט danbooru2021. המאגר מכיל מעל חמישה מיליון תמונות עם מזהים עד 6,857,737, כולל תוספת של מעל 1.8 מיליון פריטים חדשים. הרשומות כוללות תמונות בפורמטים מגוונים לצד מטא-דטה מפורט על אמנים, זכויות יוצרים, דמויות ותיאורי סצנה. בממוצע יש כשלושים תגיות לכל תמונה.

הקבצים מחולקים למבנה של 1,000 תיקיות ממוספרות מ־0000 עד 0999 כדי למנוע קריסה של מערכת הקבצים. החלוקה מתבצעת לפי מודולו 1000 של מזהה התמונה. בנוסף יש תיקיות של עדכונים תקופתיים ותיקיית מטא-דטה ייעודית שמכילה קובצי json וארכיוני tar דחוסים עם מידע על התגיות והיוצרים.

מתאים ל

  • אימון מודלי text-to-image

    יצירת איורי אנימה בעזרת צימוד בין התמונות לרשימות התגיות העשירות.

  • סיווג תמונות רב-תוויות

    זיהוי אוטומטי של דמויות, סגנונות אמנותיים ותכונות ויזואליות מדויקות.

  • הסבת תמונה לתמונה

    אימון מודלים של image-to-image על סגנונות ציור ועיבוד קווי מתאר.

איפה זה נופל

הקבצים הגולמיים מלאים בבעיות טכניות שהמפתחים עצמם מזהירים מפניהן. תמצאו שם קבצים קטועים, מרחבי צבע שאינם sRGB, וסיומות קבצים שגויות כמו קובצי PNG עם סיומת JPG. המאגר מכיל גם פורמטים שאינם תמונות סטנדרטיות, כולל וידאו, סאונד וארכיונים דחוסים. שפות התיוג מוגבלות לאנגלית וליפנית בלבד, ואין כאן עברית כלל. התוכן מוטה לחלוטין לסגנון אנימה ואיורי מעריצים, ולכן אינו מתאים לאימון ראייה ממוחשבת כללית.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

דף המאגר מוגדר תחת רישיון MIT שמאפשר שימוש מסחרי. יחד עם זאת, התמונות מציגות יצירות מוגנות וזכויות יוצרים של אמנים, ולכן שימוש כזה כרוך בסיכון משפטי.

כמה נפח אחסון צריך בשביל כל הדאטהסט?

הנפח הכולל מגיע לכ־8 טרה-בייט. תצטרכו שטח דיסק משמעותי ותשתית אחסון חזקה כדי להתמודד עם גודל כזה ועם מיליוני הקבצים שבפנים.

האם יש במאגר תמיכה או תיוג בעברית?

אין שום תיוג בעברית. השפות היחידות שנתמכות במטא-דטה הן אנגלית ויפנית, בהתאם לקהילת האתר שממנו המידע נאסף.

מאיפה הנתונים הגיעו ואיך הם נאספו?

הנתונים נאספו מלוח התמונות Danbooru כהרחבה למאגר danbooru2021 הוותיק. התיוגים והחלוקה לקטגוריות בוצעו ידנית על ידי חברי הקהילה של האתר לאורך השנים.

איך טוענים

המאגר שוקל כ־8 טרה-בייט, כך שאי אפשר להוריד אותו בלי תכנון מוקדם של אחסון ורוחב פס. אין צורך באישור גישה מיוחד, והטעינה יכולה להתבצע ישירות מהקבצים או באמצעות סקריפט danbooru2023.py הכלול במאגר. שימו לב שהנתיב לכל קובץ נגזר מהמזהה שלו, וישנם קובצי מטא-דטה נפרדים כמו posts.json וארכיוני tags.tar.xz שחייבים לפרוס כדי לחבר בין התמונות לטקסט.

from datasets import load_dataset

ds = load_dataset("nyanko7/danbooru2023")

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון מאפשר שימוש חופשי, כולל שימוש מסחרי ושינוי הקוד והנתונים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. עם זאת, התמונות עצמן נאספו מיוצרים שונים ברשת וכוללות זכויות יוצרים על הדמויות והאיורים, כך שרישיון הקוד אינו מנקה את הסיכון המשפטי בשימוש מסחרי ישיר בתמונות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗