GPT
R

RefCOCO

קוד פתוח

lmms-lab-encoderרישיון לא דווח2024-01-27

גרסה ארוזה של RefCOCO שמיועדת לבדיקת מודלים מולטי-מודאליים על משימות הבנת שפה ותמונה. המאגר מארגן את הנתונים המוכרים בצורה שמתאימה ישירות לכלי ההערכה של lmms-eval.

  • 5,195הורדות בחודש
  • 38לייקים

מה זה

המאגר כולל גרסה ערוכה של RefCOCO, דאטהסט שמתבסס במקור על עבודת ReferItGame ומשמש להפניה לאובייקטים בתוך תמונות באמצעות שפה טבעית. המטרה של מי שהעלה אותו היא לאפשר הערכה מהירה של מודלי שפה ותמונה גדולים בלי להתעסק בהמרות פורמטים ידניות.

מבנה הקבצים מראה חלוקה מוגדרת למספר סטים מוכרים של המשימה. יש כאן קובצי ולידציה שמחולקים לארבעה חלקים, סט בדיקה כללי בשני חלקים, וחלוקות מוכרות נוספות כמו testA ו־testB שנמצאות בקבצים נפרדים. הכרטיס עצמו מינימלי מאוד ולא מפרט שום מעבר לקישור לפרויקט refer המקורי ולציטוט של המאמר מ־2014.

מתאים ל

  • הערכת מודלים רב-מודאליים

    הרצה ישירה של מבחני ביצועים מול כלי lmms-eval לבדיקת יכולת זיהוי עצמים לפי תיאור טקסטואלי.

  • בדיקת ביצועי הבנת שפה חזותית

    מדידת הדיוק של מודלי ראייה ממוחשבת בקישור בין שפה טבעית באנגלית לבין אובייקטים בתוך תמונה.

  • מחקר והשוואה אקדמית

    השוואת תוצאות מול בנצ'מרק RefCOCO המוכר בלי להמיר ידנית את הנתונים המקוריים.

איפה זה נופל

הכרטיס לא מדווח על הטיות, סינונים או מגבלות ספציפיות שבוצעו בהמרה הזו. הנתונים מתבססים על מחקר שפורסם ב־2014, כך שהשפה וההקשרים משקפים את התקופה ההיא. אין כאן שום אזכור לעברית, המשימה כולה באנגלית. מכיוון שהתיעוד כאן כמעט ריק, כל בדיקה של איכות הדאטה מחייבת אתכם לחזור למאמר המקורי של ReferItGame ולמאגר המקורי של refer כדי להבין איך האובייקטים תויגו.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפיתוח מוצר מסחרי?

לא מומלץ כרגע, כי לא דווח שום רישיון בעמוד הדאטהסט. בהיעדר רישיון כתוב, אין לכם זכות שימוש מוגדרת. כדי לבדוק שימוש מסחרי תצטרכו לברר את תנאי הרישיון של RefCOCO המקורי ושל התמונות מ־COCO שעליהן הוא נשען.

האם יש בדאטהסט תמיכה בעברית?

לא. הדאטהסט מבוסס כולו על טקסטים באנגלית שמפנים לאובייקטים בתמונות, לפי עבודת המחקר המקורית מ־2014. אם המודל שלכם אמור לקבל הנחיות בעברית, הנתונים האלה לא יעזרו לכם.

במה הגרסה הזו שונה מ־RefCOCO המקורי?

התוכן מבוסס על אותו מקור, אבל הקבצים כאן הומרו לפורמט Parquet וחולקו מראש למבנה שמתאים ישירות להרצה עם חבילת הבדיקות lmms-eval. זה חוסך את העבודה הסיזיפית של הורדה ופרסור של הפורמטים הישנים.

איך נאספו הנתונים במקור?

המידע נאסף במסגרת פרויקט ReferItGame שפורסם ב־EMNLP 2014. אנשים שיחקו משחק שבו צד אחד תיאר אובייקט בתמונה בשפה טבעית והצד השני היה צריך לזהות אותו, והתיאורים הללו הפכו לדאטהסט הפניות על גבי תמונות.

איך טוענים

הנתונים יושבים בעשרה קבצים במאגר, בעיקר קובצי Parquet תחת תיקיית data. אפשר לטעון אותם דרך ספריית datasets הרגילה של Hugging Face או להריץ אותם ישירות דרך חבילת lmms-eval שהדאטהסט הותאם עבורה. אין צורך באישור גישה מיוחד כדי להוריד. הכרטיס לא מציין את המשקל הכולל של הקבצים בגיגה-בייטים או את שמות השדות המדויקים בתוך הטבלאות, כך שתצטרכו לקרוא רשומה אחת כדי לראות את מבנה העמודות לפני שרצים על הכל.

from datasets import load_dataset

ds = load_dataset("lmms-lab-encoder/RefCOCO")

הרישיון

הרישיון של המאגר לא דווח כלל בעמוד. המשמעות ברורה, מבחינה משפטית אין לכם הרשאה מפורשת להשתמש בנתונים האלה, בטח שלא לאימון מודל מסחרי או להפצה. לפני שאתם בונים על זה משהו מעבר לבדיקות פנימיות או מחקר אקדמי, תצטרכו לבדוק את תנאי הרישוי במאגר refer המקורי ובפרויקט COCO שממנו נלקחו התמונות.

הרישיון המלא ב־Hugging Face ↗