GPT
C

COCO

קוד פתוח

HuggingFaceM4cc-by-4.02022-12-14

גרסה זו מביאה את סט התמונות של COCO משנת 2014 עם חלוקת קארפטי לתיאורי תמונה. היא מתאימה למי שרוצה לאמן או לבחון מודלי ראייה ושפה על בסיס נתונים מוכר בלי להגדיר חלוקות לבד.

  • 2,811הורדות בחודש
  • 33לייקים

מה זה

המאגר מכיל תמונות לצד תיאורי טקסט באנגלית, כאשר כל תמונה מקושרת לחמישה תיאורים שונים. במקור COCO כולל מעל 330 אלף תמונות עם אובייקטים מתויגים, אך כאן מוגש תת הסט של שנת 2014 בלבד. הדאטהסט מאורגן לפי החלוקה המוכרת של אנדריי קארפטי שמשמשת רבות למשימות כיתוב תמונה.

המבנה של כל רשומה כולל את קובץ התמונה עצמו, מזהים שונים, שמות הקבצים, החלוקה שאליה הרשומה שייכת כמו למשל restval, ומערך משפטים שמכיל את הטקסט המלא ורשימת טוקנים מפורקת. הכרטיס לא מפרט איך התמונות והטקסטים נאספו וסוננו במקור מעבר להפניה למאמר המקורי.

מתאים ל

  • אימון מודלי כיתוב תמונה

    חיבור בין תמונות לתיאורי טקסט מרובים באנגלית עבור מודלים מולטימודליים.

  • בנצ'מרק של קארפטי

    הערכת ביצועים על חלוקת המבחן המקובלת של קארפטי להשוואה מול מחקרים קודמים.

  • מידול שפה מונחה ראייה

    אימון שלבים של חיבור טוקנים מטקסט לאזורים ויזואליים בתמונות מתוך הסט.

איפה זה נופל

הכרטיס הנוכחי כמעט ריק ממידע ביקורתי ומשאיר את רוב הסעיפים הטכניים תחת ציון שחסר מידע. אין שום תיעוד בכרטיס על הטיות גזעיות או מגדריות, מקור התמונות, או זהות המתייגים. בנוסף, מדובר רק בנתוני 2014 ולא בגרסת 2017 המאוחרת יותר, והטקסט קיים באנגלית בלבד ללא שום תמיכה בעברית.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 שמתיר במפורש שימוש מסחרי. החובה המרכזית שלכם היא לתת ייחוס מתאים ליוצרים המקוריים לפי תנאי הרישיון. מודל שאומן על הנתונים אינו חייב להיות מופץ תחת אותו רישיון.

האם יש בדאטהסט נתונים או תיאורים בעברית?

לא, כל התיאורים והטוקנים במאגר כתובים באנגלית בלבד. אם אתם מכוונים לפיתוח כלי שמבין עברית, תצטרכו לתרגם את הנתונים בעצמכם או לאמן על מאגר אחר.

מה ההבדל בין מאגר זה לבין הגרסה המלאה של COCO?

המאגר הזה מוגבל לתת הסט של שנת 2014 בלבד ומסודר סביב החלוקה של קארפטי למשימות כיתוב. גרסת 2017 המלאה לא קיימת כאן, ולכן הוא מתאים בעיקר למי שרוצה לשחזר תוצאות ממחקרים שמשתמשים בחלוקה הזו.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות הקובץ COCO.py שנמצא בפנים. אין צורך באישור גישה מיוחד כדי להוריד אותו. המאגר עובד עם תמונות בפורמט PIL ושדות מפתח כמו image לקובץ התמונה ו־sentences לטקסטים ולטוקנים, כך שצריך לקחת בחשבון נפח אחסון לתמונות וזמן פריסה של קבצים גרפיים.

from datasets import load_dataset

ds = load_dataset("HuggingFaceM4/COCO")

הרישיון

המאגר מפורסם תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר להתאים את החומרים וליצור נגזרות, כולל אימון מודלים. התנאי המרכזי הוא מתן קרדיט מתאים ליוצרים המקוריים, ואין חובה לשתף את המודל או התוצרים באותו הרישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗