GPT
D

danbooru2026

קוד פתוח

nyanko-devsmit2026-07-18

  • anime
  • danbooru
  • art

מעל 11 מיליון איורי אנימה עם תיוג קהילתי עשיר, שמיועדים לאימון מודלי יצירה וסיווג. המאגר מרחיב גרסאות קודמות בכמה מיליוני תמונות ומסודר מראש בפורמט אחיד.

  • 9,531הורדות בחודש
  • 23לייקים

מה זה

המאגר מבוסס על אתר התמונות Danbooru ומכיל איורים בסגנון אנימה יחד עם המטא-דאטה והתגים שנאספו מהקהילה לאורך השנים. מדובר בהרחבה ישירה של danbooru2023, עם תוספת של יותר מ־4.5 מיליון תמונות וטווח מזהים שמגיע עד מעבר ל־11.7 מיליון.

כל הקבצים עברו סינון טכני כדי לוודא שאינם פגומים, וכל תוכן שאינו תמונה רגילה, כמו אנימציות, סרטונים וקבצי קול, הוצא החוצה. התמונות שנותרו הומרו כולן לפורמט WebP ועברו הקטנה אם הרזולוציה שלהן חרגה מ־4 מיליון פיקסלים, תוך שמירה על יחס הגובה והרוחב המקורי ובלי לבצע הגדלה מלאכותית לתמונות קטנות.

מתאים ל

  • אימון מודלי טקסט לתמונה

    התאמת מודלי דיפוזיה ליצירת איורים מבוססי סגנון אנימה לפי תגיות טקסט מדויקות.

  • סיווג תמונות ומולטימודל

    זיהוי מאפייני דמויות, סגנונות ציור ופרטי לבוש באמצעות התיוג המפורט שנאסף.

  • משימות תמונה לתמונה

    אימון מודלים לשינוי סגנון או השלמת פרטים באיורים קיימים.

איפה זה נופל

הנתונים מוטים לחלוטין לסגנון אנימה ואינם כוללים צילומים מהעולם האמיתי. התיוג נשען על קהילת משתמשים בשפות אנגלית ויפנית בלבד, ללא עברית כלל. מעבר לכך, המאגר מסומן כעבודה בתהליך, והתמונות עברו המרה כפויה ל־WebP עם הגבלת רזולוציה, כך שהמידע על הפורמט המקורי אבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

קובצי המאגר והמטא-דאטה מוגדרים תחת רישיון MIT, אך כרטיס המאגר מדגיש שזכויות היוצרים על התמונות עצמן שייכות ליוצרים המקוריים שלהן. זה מייצר סיכון משפטי באימון מודלים מסחריים ישירים. מומלץ להתייעץ משפטית לגבי שימוש הוגן לפני שמשלבים את המידע במוצר.

האם יש במאגר תמיכה בעברית?

אין במאגר עברית כלל. כל התגיות והתיאורים מנוהלים באנגלית, ביפנית או בתערובת של שתיהן. אם אתם בונים מערכת שמכוונת לפרומפטים בעברית, תצטרכו לתרגם את המטא-דאטה בעצמכם.

מה ההבדל בין המאגר הזה לגרסת 2023?

המאגר הזה מרחיב את danbooru2023 ביותר מ־4.5 מיליון פריטים ומביא את הסך הכולל ליותר מ־11 מיליון תמונות. בנוסף, כל התמונות כאן עברו עיבוד אחיד מראש לפורמט WebP עם הגבלת גודל של 4 מגה-פיקסל.

איך התמונות מסודרות בקבצים?

התמונות מחולקות ל־1,000 קובצי ארכיון ממוספרים לפי שארית החלוקה של מזהה הפוסט ב־1,000. המטא-דאטה נשמר בנפרד בקובצי Parquet ו־JSON בתיקיית metadata, ומשם שולפים את המזהה כדי למצוא את הנתיב לקובץ התמונה המתאים.

איך טוענים

הורדת המאגר דורשת התמודדות עם 1,000 קובצי tar שונים בתיקיית original, לצד קובצי מטא-דאטה בפורמט Parquet ו־JSON. הגישה חופשית ואינה דורשת אישור מיוחד. התמונות ממוינות לתיקיות ממוספרות מ־0000 עד 0999 לפי מזהה הפוסט מודולו 1,000, ולכן קל לאתר קובץ ספציפי לפי המזהה שלו בטבלת הנתונים.

from datasets import load_dataset

ds = load_dataset("nyanko-devs/danbooru2026")

הרישיון

המאגר עצמו מופץ תחת רישיון MIT שמאפשר שימוש חופשי כולל שימוש מסחרי, אך התמונות המקוריות שומרות על זכויות היוצרים של היוצרים שלהן. מודל שתאמנו עלול להכיל תוכן מוגן, כך שמבחינה משפטית צריך לבדוק היטב שימוש מסחרי בתוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗