GPT
P

PD12M

קוד פתוח

Spawningcdla-permissive-2.02024-09-26

  • image

מאגר של 12.4 מיליון צמדי תמונה וטקסט שנבנה מנחלת הכלל. הוא מיועד למי שרוצה לאמן מודלים בלי להסתבך עם תביעות זכויות יוצרים וקישורים שבורים.

  • 3,616הורדות בחודש
  • 184לייקים

מה זה

המאגר מורכב מתמונות תחת רישיונות Public Domain ו־CC0 שנאספו ונאצרו באמצעות פלטפורמת Source.Plus. המטרה היתה לפתור בעיות אופייניות לסריקות רשת רגילות, כמו נוכחות של חומרים מוגנים בזכויות יוצרים, תמונות ברזולוציה נמוכה, תוכן אלים, תוכן למבוגרים ופרטים מזהים.

התוכן מחולק לכמה חלקים. החלק הראשון הוא קובצי Parquet של מטא-דאטה שכוללים מזהה ייחודי, כתובת URL של התמונה, תיאור טקסטואלי שעבר כתיבה אוטומטית מחדש, מידות רוחב וגובה בפיקסלים, סוג קובץ, גיבוב MD5, קישור לרישיון והארגון שממנו התמונה נלקחה. החלק השני הוא התמונות עצמן, שמאוחסנות בבאקט S3 ייעודי באמזון כדי למנוע היעלמות תמונות עם הזמן. בנוסף, יש תיקיית אמבדינגס שמכילה קובצי npy שחושבו באמצעות CLIP ViT-L/14.

מתאים ל

  • אימון מודלי יצירת תמונה

    בניית מודלי בסיס לטקסט לתמונה על דאטה נקי מתביעות זכויות יוצרים.

  • אימון מודלי חיפוש וטקסט

    שימוש באמבדינגס המוכנים של CLIP לחיפוש דמיון סמנטי בין תמונות לטקסט.

  • הערכת ביצועי מודלים

    בדיקת יכולות פיענוח של תמונות ארכיון ויצירות היסטוריות מנחלת הכלל.

איפה זה נופל

הטקסטים במאגר הם באנגלית בלבד, ואין פה ייצוג לשפות אחרות או לעברית. התיאורים נוצרו באופן אוטומטי, כך שצריך לקחת בחשבון אי-דיוקים מובנים במודלים שיצרו את הטקסט המקורי. בנוסף, התבססות מלאה על נחלת הכלל ו־CC0 גוררת הטיה היסטורית וויזואלית מובהקת, כי חומרים מודרניים רבים פשוט מוגנים בזכויות יוצרים ולא נמצאים כאן. אם אתם צריכים מודל שמבין מציאות עכשווית או מותגים עדכניים, הדאטהסט הזה לבדו לא יספיק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא CDLA-Permissive-2.0 והתמונות נאספו ממקורות בנחלת הכלל או תחת CC0. אין מניעה חוקית לאמן עליו מודלים שמיועדים למכירה או לשימוש מסחרי.

האם יש במאגר נתונים בעברית?

לא. השפה היחידה המדווחת בכרטיס המאגר היא אנגלית. כל הכתוביות שנכתבו מחדש עבור התמונות הן באנגלית בלבד.

איך התמונות עצמן נשמרות והאם קישורים עלולים להישבר?

בניגוד למאגרים שמסתמכים על השרתים המקוריים שבהם התמונות עלו, כאן כל התמונות הועלו לבאקט ייעודי של AWS S3. זה מבטיח שהקבצים יישארו זמינים ולא ייעלמו בגלל קישורים שבורים.

מה ההבדל בין המאגר הזה למאגרי סריקה רגילים כמו LAION?

המאגר הזה מתמקד אך ורק בחומרים ללא זכויות יוצרים, ומסנן תכנים אלימים או מידע פרטי מזהה. בנוסף, הכתוביות עברו כתיבה אוטומטית מחדש לשיפור האיכות במקום שימוש בטקסט חלופי אקראי מהרשת.

איך טוענים

טוענים את המטא-דאטה מתוך 145 הקבצים במאגר דרך קובצי Parquet סטנדרטיים, בלי צורך באישור גישה מקדים. השדות המרכזיים לעבודה הם url, caption והאמבדינגס של CLIP. התמונות לא יושבות ישירות בתוך הריפו של הדאטהסט אלא בבאקט S3 נפרד בשם pd12m, ולכן הורדת התמונות עצמן דורשת תהליך משיכה נפרד של מיליוני קבצים לפי הכתובות המופיעות ברשומות.

from datasets import load_dataset

ds = load_dataset("Spawning/PD12M")

הרישיון

המאגר מופץ תחת רישיון CDLA-Permissive-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, מחקר, שינוי ושיתוף של הנתונים, לצד החרגה של זכויות יוצרים על התמונות עצמן שהוגדרו כנחלת הכלל או CC0. אין חובה לשתף מודלים או נגזרות תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗