GPT
P

pixelprose

קוד פתוח

tomg-group-umdcc-by-4.02024-06-14

  • croissant

מאגר של 16.9 מיליון תיאורי תמונות מפורטים שנוצרו על ידי מודל ראייה. הוא מיועד למי שצריך תיאורים עשירים בהרבה מטקסט חלופי קצר כדי לאמן מודלי תמונה וטקסט.

  • 791הורדות בחודש
  • 172לייקים

מה זה

המאגר מכיל 16,896,214 זוגות של תמונות ותיאורים. הבסיס נלקח משלושה מקורות מוכרים ברשת: מעל 9 מיליון רשומות מגיעות מ־CC12M, עוד 6.5 מיליון מ־CommonPool, וכ־1.3 מיליון מתוך RedCaps. לכל תמונה הוצמד תיאור סינתטי צפוף ומפורט שהופק באמצעות Gemini 1.0 Pro Vision, במקום להסתמך רק על הכיתוב המקורי מהאינטרנט.

לצד התיאורים החדשים והמקוריים, הרשומות כוללות מידע תומך נרחב. יש בהן ציוני איכות אסתטית, זיהוי סימני מים, ונתוני בטיחות מגוונים כמו רמות רעילות, שפה בוטה, פגיעה בזהויות ותוכן מיני מפורש. בחלק שמקורו ב־RedCaps נשמרו גם נתונים ייחודיים כמו מחבר, סאברדיט וניקוד.

מתאים ל

  • אימון מודלי יצירת תמונה

    שימוש בכיתובים עשירים ומדויקים של תמונות כדי לשפר היענות להנחיות טקסטואליות מורכבות.

  • כוונון מודלי ראייה-שפה

    אימון של מודלי VLM על זוגות של תמונה וכיתוב צפוף למשימות תיאור תמונה ומענה לשאלות ויזואליות.

  • סינון נתונים לפי איכות

    בניית תתי-מאגרים נקיים לאימון באמצעות ציוני האסתטיקה, זיהוי סימני המים ומדדי הרעילות המובנים.

איפה זה נופל

כל התיאורים כאן נוצרו באנגלית בלבד. אין במאגר עברית בכלל, כך שלאימון ישיר לשפה המקומית הוא לא יעזור בלי תרגום. בעיה נוספת היא שכל הטקסט העשיר יוצר על ידי Gemini, מה שמכניס את ההטיות, הניסוחים הקבועים והטעויות האופייניות למודל הזה.

בנוסף, חלק מקובצי המקור ברשת נעלמים עם הזמן. אם תנסו להוריד את התמונות ישירות מהקישורים בעצמכם, קישורים שבורים יובילו לכך שלא תצליחו לשחזר את כל 16.9 מיליון הרשומות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא cc-by-4.0, שמאפשר שימוש מסחרי מלא כולל אימון מודלים למטרות רווח. החובה היחידה שלכם היא לתת ייחוס מתאים לחוקרים שפרסמו אותו.

האם הדאטהסט כולל תמיכה בעברית?

לא, הנתונים והתיאורים קיימים באנגלית בלבד. כדי להשתמש בו לאימון מודלים בעברית תצטרכו לתרגם את הטקסטים באופן עצמאי.

איפה נמצאות התמונות עצמן?

קובצי ה־parquet במאגר הזה כוללים רק טקסטים, ציונים וקישורים לתמונות. את התמונות עצמן יש להוריד מהרשת באמצעות הקישורים בעמודת url, או להוריד כקובצי tar ממאגר ייעודי שהחוקרים קישרו אליו.

מה היתרון של המאגר על פני CC12M הרגיל?

ההבדל העיקרי הוא איכות ועומק הטקסט. במקום הכיתובים המקוריים מהאינטרנט שלעיתים קרובות קצרים או חלקיים, כאן כל תמונה תוארה מחדש בפירוט רב על ידי מודל Gemini, ונוספו מדדי איכות ובטיחות לכל רשומה.

איך טוענים

טוענים את המידע ישירות בספריית datasets של Hugging Face או מורידים את קובצי ה־parquet דרך Git LFS. המאגר ציבורי לחלוטין ואין צורך לבקש אישור גישה מראש. אפשר להוריד את כל המאגר או לבחור ספציפית באחד מהחלקים: commonpool, cc12m או redcaps.

הקבצים כאן כוללים רק קישורים ומטא-דאטה, ולא את קובצי התמונה עצמם. כדי לקבל את הפיקסלים צריך להוריד את התמונות מהקישורים שבעמודת url, למשל בעזרת כלי כמו img2dataset, או למשוך את קובצי ה־tar המוכנים מהמאגר הנפרד שפתחו החוקרים. השדות המרכזיים לעבודה הם vlm_caption שמכיל את התיאור העשיר, לצד aesthetic_score ומדדי הרעילות לצורך סינון.

from datasets import load_dataset

ds = load_dataset("tomg-group-umd/pixelprose")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש חופשי לגמרי, כולל שימוש מסחרי ואימון מודלים מסחריים, ואינו דורש שתשחררו את התוצרים שלכם באותו רישיון. התנאי היחיד הוא מתן קרדיט ברור ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗