GPT
D

diffusiondb

קוד פתוח

poloclubcc0-1.02022-10-25

  • stable diffusion
  • prompt engineering
  • prompts
  • research paper

המאגר מרכז 14 מיליון תמונות שנוצרו בתוכנת סטייבל דיפיוז'ן יחד עם הפרומפטים והפרמטרים המדויקים שלהן. הוא נבנה כדי לחקור איך אנשים מנסחים הוראות למודלי תמונה ומה יוצא מזה בפועל.

  • 11,846הורדות בחודש
  • 654לייקים

מה זה

הנתונים נאספו משרת הדיסקורד הרשמי של סטייבל דיפיוז'ן, בתקופה שמשתמשים יצרו תמונות דרך בוט ייעודי. כל רשומה כוללת את קובץ התמונה, הפרומפט המקורי, ערכי סיד, גודל, צעדים, שיטת הדגימה, חותמת זמן ומזהה משתמש מוצפן כדי לשמור על פרטיות היוצרים.

המאגר מגיע בשתי גרסאות. הראשונה מכילה 2 מיליון תמונות בפורמט PNG ובנפח של 1.6 טרה-בייט, עם כמיליון וחצי פרומפטים ייחודיים. הגרסה השנייה, המלאה, כוללת 14 מיליון תמונות בפורמט WebP בנפח של 6.5 טרה-בייט ומכסה כ־1.8 מיליון פרומפטים ייחודיים. התמונות מחולקות לתיקיות של אלף קבצים, ולצידן קבצי מטא-דאטה מרוכזים בפורמט פרקט שמאפשרים תחקור של הטקסט בלבד.

תהליך הסינון התבסס בעיקר על הכללים שהיו נהוגים באותו שרת קהילתי נגד תוכן לא הולם. היוצרים הוסיפו בדיעבד סריקה אוטומטית שמעניקה לכל תמונה ולכל פרומפט ציון התאמה וסיכון לתוכן למבוגרים.

מתאים ל

  • חקר הנדסת פרומפטים

    ניתוח הקשר בין מילות מפתח, בחירת דוגמים ומשקלי הנחיה לבין איכות התוצאה הוויזואלית.

  • זיהוי זיופים ותמונות AI

    אימון מסווגים שמבדילים בין צילומים אמיתיים לתמונות שנוצרו במודלי דיפוזיה לפי חתימות סינתטיות.

  • בניית כלי עזר ליצירה

    פיתוח ממשקי השלמה אוטומטית והצעת מילות מפתח למשתמשים שמנסחים פקודות למודלי תמונה.

איפה זה נופל

הטקסטים נכתבו על ידי משתמשים ראשונים בשרת דיסקורד סגור, לרוב חובבי טכנולוגיה מנוסים שמילאו פרומפטים ברשימות מילות מפתח מופרדות בפסיקים. הניסוחים האלה כמעט כולם באנגלית ולא משקפים דיבור טבעי, כתיבה בעברית, או עבודה עם מודלים אחרים כמו מידג'רני. בנוסף, למרות המסננים האוטומטיים והציונים שמופיעים במטא-דאטה, תמונות בעייתיות או אלימות עדיין התפזרו פנימה, כך שחובה להפעיל סף סינון עצמאי לפני שמשלבים את המידע בתהליכי אימון.

שאלות
נפוצות

מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר כולו שוחרר תחת רישיון נחלת הכלל CC0, והתמונות שנוצרו במקור בסטייבל דיפיוז'ן הופצו מראש ללא זכויות יוצרים. אתם יכולים לאמן מודלים מסחריים או להשתמש במידע באפליקציות עסקיות בלי חובת קרדיט.

כמה שטח אחסון צריך בפועל כדי לעבוד איתו?

התשובה תלויה בצורך. אם אתם חוקרים רק את הטקסטים וההגדרות, מספיק להוריד את קובץ הפרקט הבודד. אם אתם זקוקים לתמונות עצמן, תצטרכו לפנות לפחות 1.6 טרה-בייט לחבילה המצומצמת של 2 מיליון תמונות, או 6.5 טרה-בייט לחבילה המלאה של 14 מיליון תמונות.

האם יש במאגר פרומפטים בעברית?

רוב מכריע של הטקסט נכתב באנגלית. מופיעים מעט קטעים בספרדית, סינית ורוסית, אבל עברית לא מצוינת בין השפות שקיימות בנתונים ואי אפשר להסתמך עליו לאימון בשפה הזו.

האם התמונות במאגר מסוננות מתוכן בעייתי?

הסינון לא מוחלט. למרות שבדיסקורד הופעל מסנן אוטומטי וחל איסור על תוכן מיני ואלים, היוצרים מעידים שנשארו תמונות לא ראויות. הם צירפו ציוני בטיחות מספריים לכל שורה, ותצטרכו לסנן אותן בקוד לפני השימוש לפי ערכי הסף המתאימים לכם.

איך טוענים

אין צורך בהרשמה או באישור גישה כדי להתחיל לעבוד. אם מעניין אתכם רק חקר הפרומפטים והפרמטרים, פשוט תורידו את קובץ ה־metadata.parquet או את גרסת ה־large שלו, ששוקלים מעט יחסית ונטענים ישירות ב־Pandas. מי שחייב את התמונות עצמן נכנס להרפתקת אחסון רצינית של בין 1.6 ל־6.5 טרה-בייט. אפשר לטעון תתי-קבוצות קטנות ישירות דרך ספריית datasets של Hugging Face, או להשתמש בסקריפט ההורדה שמסופק במאגר כדי למשוך חבילות ZIP לפי טווח מספרים מוגדר מראש.

from datasets import load_dataset

ds = load_dataset("poloclub/diffusiondb")

הרישיון

הנתונים משוחררים ברישיון CC0 1.0, שמשמעותו ויתור מלא על זכויות יוצרים ומעבר לרשות הציבור. אפשר להשתמש בתמונות ובפרומפטים לכל מטרה, כולל מוצרים מסחריים ואימון מודלים, בלי חובת ייחוס ובלי דרישה לשתף תוצרים עתידיים ברישיון זהה. קוד הפייתון שמצורף למאגר מופץ בנפרד ברישיון MIT.

הרישיון המלא ב־Hugging Face ↗