GPT
V

VQAonline

קוד פתוח

ChongyanChencc-by-sa-4.02023-12-22

שאלות ותשובות ויזואליות אמיתיות לחלוטין מתוך קהילות StackExchange, עם תמונות, הקשר וטקסטים מפורטים. הוא מתאים למי שרוצה לבחון מודלים על בעיות אמיתיות של בני אדם ולא על שאלות סינתטיות קצרות.

  • 5,975הורדות בחודש
  • 16לייקים

מה זה

המאגר מכיל 64,696 שאלות ויזואליות שנאספו ישירות מקהילת StackExchange על פני 105 נושאים שונים. כל רשומה כוללת את התמונה שהעלה המשתמש, הקשר טקסטואלי שמבהיר את השאלה, ואת התשובה שהשואל עצמו סימן כמקובלת מתוך כל התשובות שנכתבו בפורום.

בניגוד למאגרי VQA רגילים שבהם התשובות כוללות מילים בודדות, כאן התשובות ארוכות מאוד ומגיעות לממוצע של 173 מילים. החלוקה הפנימית לא סטנדרטית בעליל: אימון כולל 665 שאלות, ולידציה 285 בלבד, וכל השאר, 63,746 שאלות, יושב בסט הבחינה כדי לבדוק יכולות בלמידה ממעט דוגמאות.

מתאים ל

  • הערכת ביצועי מודלי שפה וראייה

    בחינת מודלים רב-מודאליים על שאלות אמיתיות ומורכבות מהרשת עם סט מבחן ענק.

  • למידה ממעט דוגמאות

    אימון ופרומפטינג במצב few-shot בעזרת מאות הדוגמאות הייעודיות שמגיעות עם המאגר.

  • יצירת תשובות ויזואליות ארוכות

    בדיקת היכולת של מערכות לייצר הסברים מפורטים ומנומקים לתמונות ולא רק מילים בודדות.

איפה זה נופל

החלוקה כאן בעייתית למי שרוצה לאמן מודל מאפס, כי יש פחות מאלף דוגמאות בסט האימון והוולידציה יחד. בנוסף, התוכן מגיע כולו מפורומים טכניים וקהילתיים של StackExchange באנגלית, כך שאין כאן עברית והשפה כוללת סלנג טכני, קידוד ודיונים ייעודיים. צריך לבדוק היטב אם התמונות מהפורומים רלוונטיות למוצר שלכם ולא מפרות פרטיות של גולשים שהעלו אותן במקור.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, רישיון cc-by-sa-4.0 מתיר שימוש מסחרי ומחקר. עם זאת, חובה לתת ייחוס ליוצרים, ואם אתם יוצרים נגזרת של המאגר או משנים אותו, אתם מחויבים לפרסם את התוצאה תחת אותו רישיון חופשי בדיוק.

האם הדאטהסט כולל שאלות בעברית?

לא, הנתונים נלקחו מקהילות StackExchange והם באנגלית בלבד. אם המוצר שלכם פונה למשתמשים בעברית, תצטרכו לתרגם את הנתונים או לבצע התאמות נפרדות לחלוטין.

במה הוא שונה ממאגרי VQA סטנדרטיים?

רוב המאגרים בתחום מציגים שאלות קצרות ופשוטות על תמונות עם תשובות של מילים בודדות. כאן מדובר בשאלות אותנטיות של משתמשים עם רקע והקשר, והתשובות מפורטות מאוד עם ממוצע של 173 מילים.

איך מחולק הדאטהסט בין אימון לבדיקה?

היוצרים בנו אותו במיוחד לבדיקת מודלים גדולים במעט דוגמאות. סט האימון מכיל 665 שאלות בלבד, סט הוולידציה כולל 285 שאלות, ורוב המאגר, 63,746 שאלות, שייך לסט הבחינה.

איך טוענים

מושכים את המאגר ישירות עם הפקודה git clone מכתובת המאגר בהאגינג פייס, ללא צורך באישור גישה מיוחד. המידע הטקסטואלי שמכיל את השאלות, ההקשר והתשובות מגיע בקובצי json, ואילו התמונות מפוצלות לשבע תיקיות נפרדות תחת השמות images1 עד images7, שרובן מכילות עד 10,000 קובצי png כל אחת.

from datasets import load_dataset

ds = load_dataset("ChongyanChen/VQAonline")

הרישיון

הרישיון הוא cc-by-sa-4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים כאחד, אבל אתם חייבים לתת קרדיט ליוצרים. הסעיף הקריטי הוא השיתוף הזהה: אם תשנו, תעבדו או תבנו דאטהסט חדש שמתבסס עליו, תהיו חייבים להפיץ אותו תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗