GPT
D

diffusiondb-pixelart

קוד פתוח

jainr3cc0-1.02023-05-11

  • stable diffusion
  • prompt engineering
  • prompts

תת קבוצה קטנה וממוקדת של אלפיים תמונות שנוצרו בבינה מלאכותית והומרו למראה פיקסל ארט. מתאים למי שרוצה לאמן או לבחון מודלים על סגנון רטרו מוגדר בלי להוריד מאגרי ענק.

  • 483הורדות בחודש
  • 61לייקים

מה זה

המאגר מכיל בדיוק 2,000 תמונות בפורמט PNG לצד כ 1,500 פרומפטים ייחודיים ששימשו ליצירתן. המקור מגיע מתוך DiffusionDB 2M, מאגר רחב שנאסף ממשתמשים בשרת הדיסקורד הרשמי של Stable Diffusion באוגוסט 2022, אך הדוגמאות כאן עברו עיבוד שהפך אותן לסגנון פיקסל.

המבנה מחולק לשתי תיקיות משנה שמכילות 1,000 תמונות כל אחת. בכל תיקייה יש קובץ JSON שמקשר בין מזהה התמונה לטקסט ולהיפר פרמטרים ששימשו בהפקה כמו סיד, מספר צעדים וסמפלר. בנוסף מצורף קובץ metadata.parquet שמרכז את הנתונים ומאפשר תשאול טבלאי מהיר.

מתאים ל

  • אימון LoRA לפיקסל ארט

    התאמת מודלי תמונה לסגנון פיקסלים נוקשה על בסיס סט קטן וממוקד.

  • הערכת תיאום טקסט לתמונה

    בדיקת יכולת המודל לייצר גרפיקת רטרו מפרומפטים מורכבים באנגלית.

  • חילוץ כיתובים מתמונות

    אימון מודלי ראייה להבנת מאפיינים גרפיים של משחקי וידאו קלאסיים.

איפה זה נופל

גודל המאגר זעיר, 2,000 דוגמאות בלבד, כך שלא תבנו ממנו מודל בסיס מאפס אלא לכל היותר כוונון עדין מאוד. הטקסט ברובו המוחלט באנגלית ומשקף סגנון כתיבה של חובבי בינה מלאכותית מוקדמים, עם מילות מפתח מופרדות בפסיקים. למרות קיומו של מסנן אוטומטי במקור, הכרטיס מזהיר שעדיין קיימות תמונות פוגעניות או מיניות, ומחייב סינון עצמאי לפי ציוני ה NSFW שמצורפים בנתונים לפני שילוב במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הנתונים שוחררו תחת רישיון CC0 שמוותר על זכויות היוצרים ומאפשר שימוש מסחרי מלא, כולל אימון מודלים מסחריים וללא חובת קרדיט.

כמה שוקל הדאטהסט והאם נדרש אישור להורדה?

המאגר שוקל כ 1.6 ג'יגה בייט בסך הכל. הגישה אליו ציבורית לחלוטין ואין צורך בהרשמה מיוחדת או בקשת אישור מהיוצר.

האם הדאטהסט כולל תמיכה בעברית?

לא. הפרומפטים נאספו ממשתמשי דיסקורד דוברי אנגלית ברובם המכריע, עם מעט ספרדית, סינית ורוסית. אין בו ייצוג לשפה העברית.

מה ההבדל בינו לבין DiffusionDB המקורי?

במקום 14 מיליון תמונות במגוון סגנונות, המאגר הזה לוקח דגימה של 2,000 תמונות בלבד וממיר אותן לסגנון פיקסל ארט. הוא מיועד למשימות נישה ספציפיות ולא למחקר רחב.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות שימוש במזהה jainr3/diffusiondb-pixelart. הנפח הכולל עומד על כ 1.6 ג'יגה בייט כך שאין צורך בתשתית אחסון כבדה, ואין דרישה לאישור גישה מקדים. בקובץ המטא דאטה השדות המרכזיים הם image_name ו text שמכיל את הפרומפט, לצד מדדי ציון לסינון תוכן למבוגרים.

from datasets import load_dataset

ds = load_dataset("jainr3/diffusiondb-pixelart")

הרישיון

המאגר משוחרר תחת רישיון CC0 1.0 שמקביל לנחלת הכלל. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולסחור במודלים שאומנו עליו, ללא חובת ייחוס ליוצרים וללא דרישה לשיתוף תחת אותו רישיון. קוד הפייתון במאגר כפוף לרישיון MIT.

הרישיון המלא ב־Hugging Face ↗