GPT
C

COCO-Caption

קוד פתוח

lmms-lab-encoderרישיון לא דווח2024-01-27

גרסה ארוזה מחדש של מבחן תיאור התמונות COCO משנת 2014. היא נועדה להרצה ישירה בכלי הערכה למודלים מולטימודליים בלי שתצטרכו להוריד ולסדר את התמונות והטקסטים ידנית.

  • 11,979הורדות בחודש
  • 15לייקים

מה זה

המאגר מכיל עיבוד של COCO Caption בגרסת 2014, שמבוסס במקור על תמונות יומיומיות עם כמה תיאורי טקסט אנושיים באנגלית לכל תמונה. המפרסמים לא פירטו בכרטיס את כמות הרשומות המדויקת, את מבנה העמודות המלא או איך חילקו את הנתונים, מעבר לעובדה שהמידע נארז לצורך הרצה מהירה בכלי שלהם.

מתוך שמות הקבצים אפשר לראות חלוקה שכוללת לפחות פיצול בדיקה של 15 קבצי פארקט שונים, מתוך 29 קבצים בסך הכל במאגר. אין כאן תיעוד על סינון מיוחד שנעשה מעבר להמרה לפורמט הזה, והכרטיס מסתמך ישירות על המאמר המקורי של מיקרוסופט COCO מ־2015.

מתאים ל

  • הערכת ביצועי מודל

    בדיקת איכות יצירת כתוביות באנגלית באמצעות צינור הבדיקה lmms-eval מול מדד COCO המוכר.

  • השוואה למחקרים קודמים

    הרצת בדיקות סטנדרטיות מול נתוני 2014 כדי להשוות תוצאות מול מאמרים שמודדים על אותו מבחן בדיוק.

  • אימון מודל מולטימודלי

    שימוש בקובצי הפארקט כבסיס ללימוד הקשר בין תמונה לתיאור טקסטואלי, בכפוף לבירור תנאי השימוש.

איפה זה נופל

הכרטיס כמעט ריק מפרטים טכניים. אין כאן מילה על הטיות, על מגבלות הנתונים או על מה שונה מהמקור. מדובר בנתונים מ־2014 באנגלית בלבד, כך שאם המודל שלכם אמור להבין עברית או סיטואציות מקומיות, הבדיקה הזו לא תגיד לכם עליו כלום. בנוסף, המפרסמים ייעדו את זה לכלי ההערכה שלהם, אז שמות השדות והמבנה הפנימי מותאמים לצינור העבודה שלהם ולא בהכרח למבנה המקורי של COCO.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

לא דווח רישיון בעמוד של lmms-lab-encoder. בלי הגדרת רישיון ברורה, אתם לא יכולים לדעת מה הזכויות שלכם. אם אתם צריכים שימוש מסחרי מובהק, עדיף לפנות למקור של COCO 2014 ולבדוק את תנאי הרישיון המקוריים שלו.

האם הנתונים כוללים תמיכה בעברית?

לא. COCO Caption הוא מאגר מבוסס אנגלית שנאסף במקור על ידי חוקרים בארצות הברית. כל התיאורים כאן באנגלית בלבד, ואין פה התאמה לשפה העברית או להקשר תרבותי מקומי.

איך המידע נאסף ועובד לגרסה הזו?

הבסיס הוא תמונות ותיאורים שנאספו ב־2014 עבור Microsoft COCO. יוצרי המאגר הזה, lmms-lab, פשוט המירו את המידע לפורמט parquet וסידרו אותו כך שיתאים להרצה בכלי lmms-eval. הם לא פירטו על סינון או שינוי של הטקסטים עצמם.

מה ההבדל בין המאגר הזה ל־COCO הרשמי?

ההבדל העיקרי הוא האריזה הטכנית. במקום להוריד קובצי תמונות וקבצי JSON נפרדים מהאתר של COCO, המאגר הזה מחלק את המידע ל־29 קבצים, כולל קובצי פארקט מוכנים לעבודה ישירה עם Hugging Face וכלי הערכה.

איך טוענים

אתם מושכים את הנתונים דרך ספריית datasets הרגילה באמצעות המזהה lmms-lab-encoder/COCO-Caption, בלי צורך לבקש אישור גישה מראש. המאגר יושב בקבצי parquet, כולל 29 קבצים בסך הכל שמחולקים לחלקים קטנים יותר כמו test-00000-of-00014.parquet. המשקל הכולל לא צוין בעמוד, אבל עבודה עם קבצי בדיקה מרובים דורשת לוודא שיש לכם מקום פנוי בדיסק ורוחב פס סביר להורדה.

from datasets import load_dataset

ds = load_dataset("lmms-lab-encoder/COCO-Caption")

הרישיון

בעמוד הדאטהסט לא דווח רישיון כלל. המאמר המקורי של COCO מ־2015 מוזכר שם, אבל היעדר רישיון מוגדר במאגר הנוכחי אומר שאי אפשר לדעת רשמית אם מותר להשתמש בו לצרכים מסחריים, לאימון או רק למחקר. אם אתם בונים מוצר מסחרי, שימוש בנתונים ללא רישיון מוצהר הוא סיכון משפטי שכדאי להימנע ממנו.

הרישיון המלא ב־Hugging Face ↗