GPT
R

red_caps

קוד פתוח

kdexdcc-by-4.02022-03-02

מעל 12 מיליון זוגות של תמונות וכותרות שנאספו מרדיט עבור אימון מודלי ראייה ושפה. הכותרות נכתבו על ידי משתמשים אמיתיים ומציעות תיאורים טבעיים ומפורטים יותר מטקסט חלופי של אתרים.

  • 6,688הורדות בחודש
  • 59לייקים

מה זה

המאגר כולל 12,011,111 רשומות המבוססות על פוסטים שנאספו מתוך 350 קהילות ייעודיות ברדיט בין השנים 2008 ל־2020. כל רשומה מחזיקה מזהה ייחודי, שם משתמש, קישור ישיר לקובץ התמונה, כותרת מקורית, כותרת מנוקה, שם הקהילה, ניקוד הצבעות, חותמת זמן ומזהי פוסטים מקושרים אם היו.

איסוף המידע התבצע דרך ממשקי ה־API של Pushshift ורדיט, תוך התמקדות בקהילות סביב נושאים מוגדרים כמו חיות, צמחים, מלאכת יד ואוכל, והתעלמות מקהילות שמיועדות לתמונות של אנשים או תוכן למבוגרים. נשמרו רק תמונות שאוחסנו ברדיט, Imgur או Flickr, מפוסטים שקיבלו לפחות שני לייקים ושעברו לפחות שישה חודשים מפרסומם. הטקסטים עברו ניקוי בסיסי שכלל הסרת סוגריים עם פרטים טכניים, תגיות רשתות חברתיות, אימוג'ים ותווים שאינם לטיניים.

כל הנתונים מרוכזים בחלוקה יחידה של אימון. החוקרים לא יצרו חלוקת ולידציה מובנית, וממליצים למשתמשים לדגום סט בדיקה עצמאי ששומר על היחס בין הקהילות השונות בהתאם למשימת המטרה.

מתאים ל

  • קדם אימון למודלי תמונה וטקסט

    אימון ייצוגים ויזואליים משותפים למשימות סיווג, אחזור וקישור בין תמונה לטקסט באנגלית.

  • יצירת כתוביות לתמונות

    לימוד מודלים להפקת תיאורים טבעיים וספציפיים לתמונות מחיי היומיום וחובבים.

  • הערכת עמידות לרעש ברשת

    בדיקת התנהגות מודלים על כותרות מורכבות שמכילות סלנג וקיצורים מפלטפורמות חברתיות.

איפה זה נופל

המאגר כולו באנגלית בלבד, ואין בו שום ייצוג לעברית או לקהילות מקומיות. כל התוכן משקף דמוגרפיה והטיות מערביות המאפיינות את רדיט, לצד סלנג ומונחים פנימיים של הרשת החברתית. חלק מקישורי התמונות המקוריים כבר אינם פעילים ברשת, ובפוסטים שכללו גלריה נשמרה רק התמונה הראשונה. בנוסף, למרות סינון קהילות של אנשים, המאגר לא עבר בדיקה ידנית פרטנית למחיקת פרצופים או מידע אישי מזהה.

שאלות
נפוצות

האם המאגר כולל את קובצי התמונות עצמם?

לא, המאגר מספק רק קובצי מטא-דאטה עם קישורים להורדת התמונות מהרשת. תצטרכו להוריד את התמונות בעצמכם באמצעות הכתובות המצורפות, וחלק מהקישורים עלולים להיות שבורים.

האם יש בדאטהסט תוכן בעברית?

לא, כל 350 הקהילות שנבחרו פעילות באנגלית בלבד. תהליך הסינון גם ניקה באופן יזום תווים שאינם לטיניים מתוך הכותרות.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הוא CC-BY-4.0 שמתיר שימוש מסחרי תמורת מתן קרדיט. עם זאת, הרישיון מכסה את המטא-דאטה, בעוד התמונות עצמן שייכות למשתמשים שהעלו אותן לרדיט, Imgur ו־Flickr.

למה להשתמש בזה במקום במאגרים כמו Conceptual Captions?

הכותרות ברדיט נכתבו על ידי בני אדם במטרה לתאר את הפוסט, להבדיל מטקסט אלטרנטיבי של אתרים שלעיתים קרובות הוא ספאמי או כללי מדי. החלוקה לפי קהילות מאפשרת גם שליטה נוחה בנושאי התמונות.

איך טוענים

הטעינה דרך הספרייה הרגילה של Hugging Face מושכת רק את קובץ המטא-דאטה ולא את התמונות עצמן. כדי לעבוד עם התמונות צריך להריץ סקריפט הורדה עצמאי שמושך את הקבצים מכתובות ה־URL שבשדה image_url. המאגר פתוח לחלוטין ואינו דורש הרשאה מוקדמת, אך ההורדה של מיליוני קבצים דורשת רוחב פס גדול, שטח אחסון משמעותי וטיפול בקישורים שבורים.

from datasets import load_dataset

ds = load_dataset("kdexd/red_caps")

הרישיון

המאגר מופץ תחת רישיון Creative Commons Attribution 4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים. המגבלה אינה מחייבת שיתוף תחת אותו רישיון, ומודלים שאומנו עליו יכולים לשמש לצרכים פנימיים או מסחריים בכפוף לזכויות היוצרים של בעלי התמונות המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗