GPT
V

vqa

קוד פתוח

worldcuisinescc-by-sa-4.02024-10-09

מאגר שאלות ותשובות ויזואלי סביב מאכלים ותרבויות בעולם. הוא מתאים למי שרוצה לבחון יכולות ראייה רב לשוניות במודל, במיוחד מול שאלות שמכילות הקשר מטעה.

  • 2,606הורדות בחודש
  • 30לייקים

מה זה

המאגר מבוסס על בסיס ידע של 2,414 מאכלים ו־6,045 תמונות מויקיפדיה ומ־Wikimedia Commons. כל מאכל נבחר ידנית בתנאי שיש לו ערך ייעודי, תוך סינון קטגוריות כלליות כמו גלידה וסילוק תמונות מטושטשות או כאלה שמכילות אנשים. סביב המידע הזה נבנו צמדי תמונה, שאלה ותשובה אמריקאית, כאשר המסיחים נבחרו בעזרת חיפוש דמיון וקטורי עם המודל E5 Large Instruct.

יש כאן שתי משימות עיקריות. הראשונה דורשת לזהות את שם המאכל בשלושה מצבים: בלי הקשר, עם הקשר גיאוגרפי, ועם הקשר מטעה שנועד לבדוק עמידות. המשימה השנייה מבקשת לחזות את המקור או אזור הצריכה של המנה.

השאלות נכתבו באנגלית, תורגמו על ידי דוברים ילידיים ל־30 שפות וניבים, ותרגומי המיקומים עברו תרגום מכונה עם GPT-4 ובקרה אנושית. המאגר מחולק לסט אימון של 1,080,000 דוגמאות ושני סטים להערכה בגודל 12,000 ו־60,000 רשומות, ללא חפיפת מאכלים ביניהם.

מתאים ל

  • הערכת מודלי ראייה רב לשוניים

    בדיקת יכולת זיהוי תמונות מול שאלות ב־30 שפות שונות כדי למדוד פערים בין שפות נפוצות לפחות נפוצות.

  • בדיקת עמידות להקשר מטעה

    בחינת יכולת המודל להסתמך על התמונה בלבד כאשר הטקסט כולל פרטי מיקום מוטעים במכוון.

  • אימון מערכות לזיהוי מאכלים

    כוונון עדין של מודלי שפה ותמונה על מיליון דוגמאות לקישור תמונות של מנות לתרבות ולמוצא שלהן.

איפה זה נופל

התלות בערכי ויקיפדיה קובעת מראש הטיה מובנית לטובת תרבויות וקבוצות שמתועדות היטב באינטרנט. מאכל מקומי שאין לו ערך עצמאי פשוט נשאר בחוץ. בנוסף, רשימת השפות כוללת 30 שפות וניבים אך עברית אינה מופיעה בהן. לפני שמכניסים נתונים כאלה למוצר, כדאי לזכור ששמות ללא תרגום קיבלו ברירת מחדל באנגלית, ושמדובר בתמונות ויקיפדיה טיפוסיות ולא בצילומי משתמשים אמיתיים מהשטח.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא. המאגר מכסה 30 שפות וניבים מתשע משפחות שפה, ביניהן אנגלית, ערבית, אינדונזית, צ'כית וספרדית, אך עברית אינה נכללת ברשימה.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אך כולל דרישת שיתוף זהה (ShareAlike). אם אתם משנים את הנתונים ומפיצים אותם, חובה לעשות זאת תחת אותו רישיון, מה שעלול להגביל שילוב במוצרים סגורים.

למה כדאי לשים לב לפני ההורדה של המאגר?

הגרסה הזו כוללת את כל קובצי התמונות המקוריים לצד השאלות, ולכן ההורדה כבדה. אם המטרה היא להריץ בדיקות טקסטואליות או להשתמש בקישורים בלבד, היוצרים ממליצים להוריד את גרסה 1.1 המוקטנת.

איך נאספו התמונות והשאלות?

הבסיס מגיע מתוך 2,414 ערכי ויקיפדיה על מאכלים ותרבויות, עם 6,045 תמונות ממאגר ויקישיתוף. השאלות נבנו בתבניות קבועות, תורגמו על ידי בני אדם, והאפשרויות לשאלות האמריקאיות הופקו אוטומטית לפי דמיון טקסטואלי.

איך טוענים

טוענים את הנתונים דרך ספריית datasets של Hugging Face או ישירות מקובצי ה־JSONL שמחולקים לפי שפות ומשימות בתיקיות המאגר. אין צורך באישור גישה. הגרסה הזו כוללת את כל קובצי התמונות המקוריים לצד הטקסט, מה שמנפח מאוד את נפח ההורדה, ולכן היוצרים מציעים לחלופין את גרסה 1.1 שכוללת רק טקסט ומטא דאטה.

from datasets import load_dataset

ds = load_dataset("worldcuisines/vqa")

הרישיון

המאגר מופץ תחת רישיון CC-BY-SA 4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, אך חובה לתת קרדיט ליוצרים. סעיף השיתוף הזהה מחייב שכל יצירה נגזרת, כולל שינויים או הרחבות של הדאטהסט, תופץ תחת אותו הרישיון בדיוק. אימון מודלים על נתוני SA מעורר שאלות משפטיות לגבי חובת הפצת משקלי המודל באותו רישיון, ולכן צוותים מסחריים צריכים בדיקה משפטית לפני שימוש.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗