GPT
C

COCO-Caption2017

קוד פתוח

lmms-lab-encoderרישיון לא דווח2024-01-29

גרסה מובנית של מדגם הכתוביות מקוקו 2017 שנועדה להרצה ישירה בבדיקות של מודלי ראייה ושפה. היא חוסכת את ההורדה והסידור הידני של התמונות המקוריות.

  • 4,759הורדות בחודש
  • 24לייקים

מה זה

המאגר מכיל עיבוד מחדש של מבחן הכתוביות מתוך פרויקט COCO המקורי מגרסת 2017. המטרה המוצהרת של המפרסמים היא שילוב ישיר בתוך כלי ההערכה שלהם למודלי ראייה ושפה מרובי אופנויות, כדי לאפשר בדיקה מהירה בלחיצה אחת בלי להתעסק בהמרות קבצים.

הכרטיס לא מפרט אילו שדות בדיוק נשמרו בכל רשומה, אך לפי מבנה הקבצים מדובר בנתוני מבחן שמחולקים לארבעה עשר קובצי פארקט שונים. אין כאן תיעוד לגבי סינון ספציפי שבוצע בטקסטים או בתמונות, מעבר לעובדה שהחומר נשען כולו על הנתונים המקוריים שפורסמו במחקר של מיקרוסופט משנת 2015.

מתאים ל

  • הערכת מודלי ראייה ושפה

    הרצת מבחני השוואה מהירים על כתוביות תמונה באמצעות התשתית של יוצרי המאגר.

  • בדיקת יכולות תיאור תמונה

    בחינה של מודלים מול נתוני המבחן המוכרים של קוקו 2017 בלי להוריד את המקור.

  • שילוב בכלי בדיקה אוטומטיים

    טעינה ישירה של קובצי פארקט מוכנים לצורך בדיקות תקופתיות של ביצועי מודל.

איפה זה נופל

הכרטיס כמעט ריק ממידע טכני ולא מפרט הטיות, סינונים או שינויים שנעשו במקור. הנתונים מבוססים על קוקו 2017, מה שאומר שהכתוביות והתמונות ישנות, באנגלית בלבד, ואינן כוללות עברית או הקשר מקומי. בנוסף, מדובר בנתוני מבחן שמיועדים להערכה ולא לאימון מלא של מודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

היוצרים לא ציינו רישיון בעמוד הדאטהסט. כשאין רישיון מוגדר, מבחינה משפטית אין היתר שימוש ברור, בוודאי לא למטרות מסחריות. אם אתם עובדים על מוצר כזה, כדאי לחזור למקור של קוקו 2017 ולבדוק את תנאי השימוש המקוריים שלו.

האם הדאטהסט כולל טקסטים בעברית?

לא, אין במאגר תוכן בעברית. הנתונים מתבססים במלואם על סט הכתוביות המקורי באנגלית. אם אתם צריכים לבחון מודל בעברית, תצטרכו לתרגם את הטקסטים בעצמכם או לחפש חלופה מקומית.

איך המידע הזה נאסף ונערך?

הנתונים נלקחו ישירות מפרויקט COCO מגרסת 2017 שמבוסס על המחקר של לין ושותפיו ממיקרוסופט. יוצרי המאגר הנוכחי לקחו את נתוני המבחן והמירו אותם לקובצי פארקט כדי שיתאימו לכלי ההערכה שלהם. הכרטיס אינו מפרט שום סינון או עריכה נוספת מעבר לשינוי הפורמט.

במה המאגר שונה מהורדת COCO המקורי?

ההבדל העיקרי הוא המבנה והנגישות דרך הרשת. במקום להוריד את קובצי התמונות והכתוביות הגולמיים מאתר הפרויקט ולבנות קוד טעינה, כאן הנתונים כבר שמורים בפארקט ומחולקים לחלקים. זה נועד בעיקר לחסוך עבודה למי שמשתמש בכלי הבדיקה של אותה מעבדה.

איך טוענים

הנתונים יושבים במבנה פארקט ומחולקים לארבעה עשר קבצים שונים תחת תיקיית המידע, לצד קובצי תיעוד. אין צורך בבקשת גישה מיוחדת או באישור כדי למשוך את הקבצים. אתם טוענים אותם ישירות דרך ספריית הדאטהסטים הרגילה או בעבודה ישירה מול קובצי הפארקט של המבחן. חשוב לדעת שמשקל הקבצים והשדות הפנימיים לא נרשמו בתיעוד, ולכן כדאי לבדוק קובץ בודד לפני שמושכים את כל החלקים למכונה המקומית שלכם.

from datasets import load_dataset

ds = load_dataset("lmms-lab-encoder/COCO-Caption2017")

הרישיון

בדף המאגר לא דווח רישיון כלל. ללא רישיון מוגדר אסור להניח שניתן להשתמש בנתונים למטרות מסחריות, והסטטוס המשפטי של מודל שיאומן עליהם אינו ברור. לחברות שמפתחות מוצרים מסחריים מומלץ להיזהר ולבדוק את תנאי השימוש של מקור המידע המקורי.

הרישיון המלא ב־Hugging Face ↗