GPT
D

Danbooruwildcards

קוד פתוח

X779other2024-11-22

אוסף קובצי טקסט של תגיות Danbooru להגרלת פרומפטים במודלי תמונה. הוא מיועד למי שמחפש מיליוני שילובים מוכנים של דמויות, סגנונות אמנים ומאפיינים ויזואליים בלי להמציא הכל ידנית.

  • 12,198הורדות בחודש
  • 15לייקים

מה זה

המאגר כולל 25 קבצים שמחולקים לפי קטגוריות מרכזיות של תגיות מעולם האנימה. יש כאן חלוקה לפי אמנים עם כ־0.6 מיליון סגנונות ברמות שונות, חצי מיליון שמות של דמויות שמתוכן לכ־30 אלף יש תיוג מאפיינים מלא, וקבצי DTR שמכילים כ־7 מיליון שילובי תגיות שונים לחלוטין.

התוכן מבוסס על המאגרים danbooru2023 של nyanko7 ו־danbooru2024 של deepghs. הקבצים מופרדים בין דמויות גבריות לנשיות, וכוללים גרסאות שמיועדות לתוכן בטוח לצפייה לצד קבצים כלליים, כאשר כל קובץ משמש כרשימת ערכים להגרלה אקראית בזמן יצירת תמונות.

מתאים ל

  • הגרלת פרומפטים באנימה

    יצירה אוטומטית של וריאציות מגוונות לכלי יצירת תמונה באמצעות wildcards של דמויות ותגיות.

  • בדיקת יכולות של מודלים

    אימות טענות של מודלי אנימה על זיהוי אלפי דמויות בעזרת קובץ בדיקה שמכיל 15,000 שמות מתויגים.

  • העשרת פרומפטים עם TIPO

    חיבור הנתונים להרחבות כמו z-tipo-extension כדי לשדרג תיאורים קצרים לשילובי תגיות עשירים.

איפה זה נופל

הטקסט כולו באנגלית בלבד ומבוסס לחלוטין על ז'אנר האנימה ותרבות Danbooru, כך שאין לו שום שימוש מחוץ לתחום הזה. גרסאות ה־SFW לא מבטיחות סינון מוחלט של תכנים בוטים, ועדיין עלולות להופיע תמונות לא הולמות בלי הפעלת מנגנון חסימה ייעודי.

בנוסף, רוב האמנים ברשימה המלאה הופיעו במקור רק פעם אחת ברשת, ואף מודל לא באמת מסוגל לחקות את הסגנון שלהם. היוצר עצמו ממליץ להגביל את הבחירה לגרסאות של עד 5,000 אמנים מוכרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המדווח הוא other וללא פירוט ברור של תנאים מסחריים. מאחר שמדובר בתגיות שמקורן באתר Danbooru ללא רישוי קוד פתוח סטנדרטי, מומלץ לא להסתמך עליו במוצר מסחרי.

האם יש בדאטהסט תמיכה בעברית?

לא, כל 25 הקבצים כוללים תגיות באנגלית בלבד. המבנה מבוסס על שמות ותגיות פנימיות של אתר Danbooru, כך שעברית כלל אינה קיימת כאן.

איך הנתונים נאספו והורכבו?

הקבצים נבנו על בסיס שני מאגרי נתונים קיימים של תמונות ותגיות, danbooru2023 ו־danbooru2024. היוצר סינן, חילק את התגיות לקטגוריות של גברים, נשים וגרסאות מסוננות, ויצר קובצי טקסט להזנה ישירה למחוללי תמונות.

למה הקבצים תוקעים את המחשב אם פותחים אותם?

קבצי ה־DTR מכילים כ־7 מיליון שורות של שילובי תגיות. עורכי טקסט רגילים כמו פנקס רשימות או VSCode מתקשים לעבד קובצי טקסט במשקל כזה בזיכרון, ולכן ההנחיה היא להעביר אותם ישירות לתיקיית היעד בלי לנסות לקרוא אותם ידנית.

איך טוענים

אין צורך בקוד פייתון מורכב, מורידים את קובצי ה־TXT וזורקים אותם לתיקיית wildcards בתוכנות כמו Automatic1111 עם התוסף sd-dynamic-prompts, Fooocus או ComfyUI. הגישה חופשית לגמרי בלי הרשאות מיוחדות.

רק שימו לב לא לפתוח קבצים שמתחילים ב־DTR או DTO בעורכי טקסט פשוטים כמו Notepad או VSCode. הם עצומים בגודלם והמחשב פשוט ייתקע.

from datasets import load_dataset

ds = load_dataset("X779/Danbooruwildcards")

הרישיון

הרישיון מוגדר כ־other ולא מצוין תחת תנאי קוד פתוח מוכרים. המשמעות היא שאין הרשאה ברורה לשימוש מסחרי, וכל שילוב של הנתונים באימון מודל מסחרי או במוצר סגור מביא איתו סיכון משפטי של הפרת זכויות.

הרישיון המלא ב־Hugging Face ↗