GPT
P

pd12m-full

קוד פתוח

Spawningcdla-permissive-2.02024-11-14

  • image

המאגר מכיל תמונות אמיתיות שהורדו מראש יחד עם טקסטים תואמים בפורמט מותאם לאימון. מי שמחפש אותו רוצה לחסוך לעצמו שבועות של הורדת קישורים שנשברים ברשת.

  • 5,877הורדות בחודש
  • 21לייקים

מה זה

המאגר כולל עותק מלא ומוכן לעבודה של PD12M המקורי. במקום לספק רק קובצי מטא דאטה וכתובות אינטרנט של תמונות שחלקן כבר לא זמינות, כאן הורידו את התוכן בפועל באמצעות הכלי img2dataset וארזו אותו ישירות לקובצי ארכיון.

המבנה מבוסס על פורמט WebDataset המחולק לקובצי tar ממוספרים, כאשר בכל ארכיון נשמרים כחמשת אלפים פריטים. כל דגימה במאגר מורכבת מתמונה בפורמט jpg שנשמרה ללא שינוי גודל או קידוד מחדש, קובץ txt שמכיל את התיאור הטקסטואלי של התמונה, וקובץ json עם נתונים נלווים.

הבסיס לחילוץ התמונות היה איחוד של כל קובצי ה־parquet ממדור המטא דאטה של המאגר המקורי לתוך טבלה אחת. משם נמשכו הכתובות והתיאורים על גבי אשכול מעבדים ונשמרו באחסון ענן, לפני שהועברו בצורה מסודרת למאגר הנוכחי.

מתאים ל

  • אימון מודלי דיפוזיה

    אימון מודלי יצירת תמונה מטקסט ישירות מתוך קובצי הארכיון בלי להתעסק בהורדות חיצוניות.

  • אימון מקבילי יעיל

    הזרמת מקטעי tar של עשרות אלפי דוגמאות בצינורות עיבוד של WebDataset על גבי מעבדים מרובים.

  • הערכת צימוד טקסט ותמונה

    מדידת ביצועים של מודלים רב מודאליים על צמדי תמונה וכיתוב שנשמרו בגודלם המקורי.

איפה זה נופל

הטקסטים מוגדרים באנגלית בלבד, כך שאין כאן תיאורים בעברית או תמיכה רב לשונית. מעבר לכך, הכרטיס הטכני לא מפרט אילו סינונים של בטיחות או איכות הופעלו במקור, ולא מציין את תאריכי האיסוף של התמונות המקוריות. מי שמתכנן לאמן מודל פרודקשן יצטרך לבדוק בעצמו את טיב התמונות והתאמת הטקסטים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המדווח הוא cdla-permissive-2.0 שאינו מגביל שימוש מסחרי. עליכם רק לוודא שאתם מצייתים לתנאי הייחוס הנדרשים ברישיון. המודלים שאתם מאמנים על גבי הדאטהסט שייכים לכם ואין חובה לפתוח את הקוד שלהם.

האם יש במאגר תיאורים בעברית?

לא, השפה היחידה שמוגדרת בדאטהסט היא אנגלית. כל התוכן הטקסטואלי שמגיע לצד התמונות נאסף באנגלית בלבד. אם המטרה שלכם היא מודל שמבין עברית, תצטרכו לתרגם את הכיתובים או להביא מקורות אחרים.

מה ההבדל בין המאגר הזה לבין PD12M המקורי?

הגרסה המקורית של Spawning כללה בעיקר מטא דאטה ורשימות של קישורים להורדה עצמאית. המאגר הנוכחי לקח את הקישורים האלה, הוריד את התמונות בפועל ושמר אותן בארכיונים מוכנים. זה מונע את הבעיה המוכרת של קישורים שבורים וחוסך זמן עבודה יקר.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית webdataset בפייתון באמצעות הזרמה מקובצי ה־tar, ללא צורך בהורדה מוקדמת של כל אלפי הארכיונים לדיסק המקומי. אין צורך בבקשת גישה מיוחדת, המאגר פתוח לחלוטין. בכל שלב באיטרציה מקבלים מילון עם מפתחות לתמונה עצמה, לתיאור הטקסטואלי ולמטא דאטה.

from datasets import load_dataset

ds = load_dataset("Spawning/pd12m-full")

הרישיון

הרישיון הוא cdla-permissive-2.0, שמאפשר שימוש חופשי ומתירני למדי, כולל התאמה לשימושים מסחריים ואימון מודלים. הרישיון דורש בעיקר שמירה על תנאי הייחוס של יוצרי הנתונים, אך אינו כופה עליכם לשתף את המודלים שתאמנו או את תוצרי הפיתוח שלכם באותו רישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗