GPT
C

cvqa

קוד פתוח

afajiרישיון לא דווח2024-04-26

מאגר שאלות ותשובות רב לשוני על תמונות מגוונות תרבותית. הוא מתמקד בניואנסים מקומיים מעשרות שפות ומדינות שלא מקבלות מענה בבנצ'מרקים המערביים הרגילים.

  • 1,771הורדות בחודש
  • 40לייקים

מה זה

המאגר מכיל מעל עשרת אלפים שאלות אמריקאיות המבוססות על תמונות, ומחולק לעשר קטגוריות שונות כמו חפצים, לבוש וחומרים. כל רשומה כוללת תמונה, שאלה בשפה המקומית, תרגום לאנגלית, וארבע אפשרויות תשובה עם תרגומן לאנגלית. המידע מכסה 39 שילובים שונים של מדינה ושפה, כולל יפנית, אינדונזית, ספרדית, מונגולית ופורטוגזית.

השאלות נכתבו ידנית על ידי דוברים ילידיים, כאשר כמעט תשעים אחוז מהם התגוררו במדינת היעד מעל 16 שנים. התמונות מגיעות משני מקורות: צילומים מקוריים שהמתייגים סיפקו, או תמונות קיימות שנאספו מהרשת. כל דוגמה עברה תהליך ולידציה על ידי מתייג נוסף כדי לוודא התאמה להנחיות וטשטוש פרטים רגישים.

מתאים ל

  • הערכת מודלים רב לשוניים

    מדידת יכולת הראייה וההבנה של מודל רב מודאלי בשפות שונות מעבר לאנגלית.

  • בדיקת הבנה תרבותית

    בחינה של זיהוי אלמנטים תרבותיים, חפצים ומנהגים מקומיים שאינם מוכרים במערב.

  • בנצ'מרק השוואתי בראייה

    השוואת ביצועי מודלים מול הלוח הציבורי של הפרויקט בפלטפורמת EvalAI.

איפה זה נופל

החיסרון המרכזי למפתח ישראלי הוא היעדר מוחלט של עברית. שפות הבדיקה אינן כוללות את ישראל, כך שאי אפשר להעריך כאן התאמה תרבותית או לשונית מקומית. בנוסף, העובדה ששדה התשובה הנכונה מאופס למינוס אחת מונעת שימוש במאגר לאימון מקומי או לבדיקה אוטומטית פנימית, ומחייבת הגשה ידנית למערכת חיצונית כדי לראות דיוק.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר כולל שפות כמו אינדונזית, יפנית, ספרדית, אירית ומונגולית, אך עברית אינה מופיעה ברשימת השפות.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

התשובה תלויה ברשומה הספציפית. לכל שורה יש רישיון נפרד, וחלק מהתמונות מוגדרות למחקר בלבד. אי אפשר להניח שימוש מסחרי גורף.

למה שדה התשובה מציג תמיד מינוס אחת?

המאגר מיועד לבדיקת ביצועים עיוורת בלבד. יוצרי הדאטהסט לא חושפים את התשובות הנכונות בקבצים, וכדי לבדוק דיוק צריך לשלוח את התוצאות לשרת ההערכה.

האם המאגר מתאים לאימון מודלים חדשים?

לא. היעדר התוביות הנכונות מונע אימון בפיקוח, והנתונים בנויים ומיועדים אך ורק להערכה כמבחן.

איך טוענים

הנתונים מחולקים לעשרה קבצי Parquet תחת תיקיית המידע. אפשר לטעון אותם דרך ספריית datasets הרגילה בלי צורך באישור גישה מוקדם או בהרשמה. שדה התשובה הנכונה מקבל תמיד את הערך מינוס אחת, מכיוון שהמאגר מוגדר כמבחן בלבד. בדיקת התוצאות נעשית באמצעות העלאת הפלטים לאתר EvalAI כדי לקבל ציון.

from datasets import load_dataset

ds = load_dataset("afaji/cvqa")

הרישיון

המאגר אינו כולל רישיון אחיד ברמת הפרויקט. הרישיון נקבע לכל שורה בנפרד לפי השדות הייעודיים ברשומה. החומרים חופשיים למחקר, אך חלק מהתמונות מוגבלות לשימוש לא מסחרי או מגיעות ברישיונות כמו ייחוס שיתוף זהה. אסור להשתמש בנתונים האלה למוצר מסחרי בלי לסנן ולבדוק כל שורה בנפרד.

הרישיון המלא ב־Hugging Face ↗