GPT
D

docci

קוד פתוח

googlecc-by-4.02023-10-31

מאגר תמונות עם תיאורים אנושיים ארוכים ומפורטים במיוחד, שמתמקדים בהבדלים דקים בין תמונות דומות. הוא נבנה במיוחד כדי לבחון איכות של מודלי תמונה וטקסט.

  • 371הורדות בחודש
  • 79לייקים

מה זה

המאגר כולל זוגות של תמונות ותיאורים טקסטואליים מפורטים באנגלית. בניגוד לתיאורים קצרים ומקובלים, כאן כל תיאור מתייחס לעומק לרקע, לתאורה, לקומפוזיציה ולפרטים משניים שמבדילים את התמונה מתמונות דומות לה. כל התמונות צולמו במקור על ידי אחד מכותבי המאמר ובני משפחתו, וכל התיאורים נכתבו ידנית על ידי בני אדם ללא כלים אוטומטיים.

מבחינת חלוקה, הסט המרכזי מכיל 9,647 דוגמאות אימון, 5,000 דוגמאות מבחן, ועוד שני סטים קטנים להערכה איכותית של 100 דוגמאות כל אחד. קיימת גם גרסה בשם DOCCI-AAR שמכילה 4,932 דוגמאות אימון ו־5,000 דוגמאות מבחן. החוקרים עברו ידנית על התמונות וטשטשו פנים, מספרי טלפון וכתובות אתרים, וסרקו את הטקסטים בכדי לוודא שאין בהם מידע מזהה.

מתאים ל

  • הערכת מודלי יצירת תמונות

    בדיקת היכולת של מודלי text-to-image לדייק בפרטי רקע, תאורה והבדלים עדינים לפי פרומפט מפורט.

  • בחינת מודלי ראייה ושפה

    מדידת הדיוק של מודלים ביצירת תיאורי תמונה מורכבים שמבדילים בין סצנות כמעט זהות.

  • כיוונון עדין למשימות פירוט

    אימון מודלים להפקת תיאורים טקסטואליים עשירים ומדויקים יותר ממה שמקובל בדאטהסטים רגילים.

איפה זה נופל

התמונות כולן מגיעות ממקור יחיד ומצומצם, אדם אחד ומשפחתו, מה שמייצר הטיה ברורה בסגנון הצילום, בסביבות ובחפצים המוצגים. הטקסט קיים באנגלית בלבד ואין בו שום ייצוג לעברית. בנוסף, כרטיס הדאטהסט לא מפרט הטיות חברתיות נוספות או מגבלות ספציפיות, כך שחובה לדגום את הנתונים ידנית לפני שמשתמשים בהם כבסיס להערכת ביצועים במערכות אמיתיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ראוי לחוקרי גוגל שיצרו את המאגר.

האם יש בדאטהסט תמיכה בעברית?

לא, כל התיאורים נכתבו באנגלית בלבד. אם רוצים להעריך יכולות בעברית, תצטרכו לתרגם את התיאורים באופן עצמאי.

מה מייחד את התיאורים האלה ממאגרים כמו COCO?

התיאורים כאן ארוכים משמעותית וכוללים פרטי רקע, תאורה, זווית צילום ומיקומים יחסיים של חפצים. הם נכתבו ידנית במטרה להבדיל בין תמונות דומות מאוד.

מאיפה הגיעו התמונות והאם יש בעיית פרטיות?

התמונות צולמו על ידי אחד החוקרים ומשפחתו. הצוות סרק את המידע, טשטש פנים ופרטים מזהים, וניקה שמות ומספרי טלפון מהטקסטים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הסקריפט docci.py שבמאגר, ללא צורך בהרשאת גישה מיוחדת. כל רשומה מחזירה אובייקט תמונה בפורמט PIL, מזהה ייחודי מסוג example_id, ומחרוזת description ארוכה. שימו לב שהתמונות שמורות ברזולוציה גבוהה יחסית, כמו 1536 על 2048 פיקסלים, כך שההורדה וטעינת הפיקסלים לזיכרון דורשות משאבי אחסון ועיבוד מתאימים.

from datasets import load_dataset

ds = load_dataset("google/docci")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מאפשר שימוש חופשי, כולל שימוש מסחרי, שינוי והפצה, כל עוד אתם נותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. הרישיון לא מחייב שיתוף באותם תנאים, ולכן אפשר לאמן או להעריך מודלים פנימיים ומסחריים בלי לחשוף את המשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗