GPT
W

WorldVQA

קוד פתוח

moonshotaiapache-2.02026-01-26

המאגר בודק אם מודלים רב-מודליים מזהים ישויות ויזואליות מהעולם האמיתי, מפריטי יומיום ועד מקרים נדירים. הוא מבודד זיכרון עובדתי טהור מהסקה לוגית מורכבת.

  • 993הורדות בחודש
  • 67לייקים

מה זה

הגרסה הזמינה כוללת 3,000 זוגות של תמונה, שאלה ותשובה שמחולקים לשמונה קטגוריות שונות. המטרה היא לבחון זיהוי ושיום ישיר של אובייקטים לפי טקסונומיה מובנית, כזו שמכסה גם עצמים נפוצים וגם פרטי מידע מהזנב הארוך. המיקוד הוא בידע אנציקלופדי ויזואלי, מתוך שאיפה לבדוק אמינות עובדתית ולמדוד שיעורי הזיות.

במקור המבחן כלל 3,500 זוגות בתשע קטגוריות, אך קטגוריית האנשים הוסרה לחלוטין מהשחרור הציבורי. היוצרים מציינים שההסרה נבעה משיקולי זכויות יוצרים, וכן בגלל נטייה של מודלים קנייניים מסחריים לסרב באופן גורף לענות על שאלות שמציגות פנים של בני אדם.

מתאים ל

  • בדיקת הזיות במודלי ראייה

    מדידת שיעור הטעויות בזיהוי ישויות ויזואליות נדירות ונפוצות ללא רעש של הסקה.

  • הערכת ידע אנציקלופדי

    מבחן ביצועים לבדיקת היקף הזיכרון הוויזואלי של מודל רב מודלי באנגלית ובסינית.

  • בנצ'מרק השוואתי

    השוואת ביצועי מודלים פתוחים מול מודלים מסחריים על שמונת תחומי הידע במאגר.

איפה זה נופל

אם אתם בונים מוצר בעברית, המאגר לא יעזור לכם לבדוק את השפה המקומית כי הטקסטים מוגבלים לאנגלית ולסינית בלבד. בנוסף, חסרה בו לחלוטין קטגוריית אישים, כך שאי אפשר לבדוק זיהוי דמויות היסטוריות או ציבוריות. המשימה היא שיום עובדתי ישיר בלבד, ולכן הוא לא מתאים למי שמחפש להעריך יכולות הסקה ויזואלית רב שלבית או פתרון בעיות מורכבות.

שאלות
נפוצות

האם המאגר מתאים לבדיקת מודלים בעברית?

לא. המאגר נבנה וסומן באנגלית ובסינית בלבד. כדי להשתמש בו למודל מקומי תצטרכו לתרגם את השאלות והתשובות באופן עצמאי.

האם מותר להשתמש בדאטהסט בפרויקט מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמתיר שימוש מסחרי חופשי. עליכם רק לשמור על תנאי הייחוס של הרישיון המקורי.

מדוע חסרה קטגוריית האנשים בדאטהסט?

היוצרים הסירו 500 זוגות של תמונות ושאלות על אנשים בגלל חשש מזכויות יוצרים. סיבה נוספת היא שמודלים מסחריים סגורים נוטים לסרב לעבד תמונות פנים.

כמה דוגמאות יש בפועל בקבצים?

בגרסה להורדה יש בדיוק 3,000 זוגות של תמונות ושאלות על פני שמונה קטגוריות. הנתונים מאורגנים בקובץ WorldVQA.tsv ומלווים בקובצי תמונה תואמים.

איך טוענים

הנתונים יושבים בקובץ טבלאי פשוט בשם WorldVQA.tsv לצד תיקיית תמונות, כך שאין צורך בצינור עיבוד מסובך. אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך Hugging Face או הקישורים בקוד של היוצרים. הרשומות מבוססות על שפות אנגלית וסינית, ודורשות התאמה בין קובץ ה־TSV לקובצי המדיה המצורפים.

from datasets import load_dataset

ds = load_dataset("moonshotai/WorldVQA")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי כאחד, ומאפשר לשנות את הנתונים ולשלב אותם בפיתוחים פנימיים. התנאי העיקרי הוא מתן קרדיט ושמירה על הודעת הרישיון המקורית, בלי חובה לשתף מודלים שתאמנו או תעריכו תחת אותו הרישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗