GPT
I

imageinwords

קוד פתוח

googlecc-by-4.02024-04-30

  • iiw
  • imageinwords
  • image-descriptions
  • image-captions
  • detailed-descriptions

המאגר כולל תיאורים מפורטים במיוחד לתמונות, שנכתבו בידי אדם או נוצרו במודלים. הוא נועד בעיקר להערכת ביצועים של מודלי ראייה ושפה, ומכיל גם שיפוטי צד לצד אנושיים.

  • 191הורדות בחודש
  • 125לייקים

מה זה

הנתונים מחולקים לחמישה חלקים שונים לפי סוג הפיצול והמקור. חלקים כמו IIW-400, DCI_Test ו־DOCCI_Test מכילים תיאורים מפורטים שנכתבו על ידי מתייגים אנושיים, לצד מדדי שיפוט אנושי שמשווים בין פלטים של מודלים שונים כמו GPT-4V. חלקים אחרים, כמו LocNar_Eval ו־CM_3600, כוללים תיאורים שנוצרו על ידי מכונה באמצעות המודל IIW-P5B.

כל רשומה מורכבת מקישורים לתמונות או שדות מזהה, יחד עם טקסט התיאור שנשמר כולו כמחרוזות. בחלק מהמקרים ישנם פירוטים של ציוני הערכה אנושיים שבודקים מקיפות, ספציפיות, הזיות, דמיון לטקסט אנושי ותקציר של השורות הראשונות. התמונות והטקסטים שנוצרו במכונה עברו סינון אלגוריתמי ובדיקה ידנית לצורך הסרת מידע אישי ורגיש, תוכן אלים ותכנים פורנוגרפיים.

מתאים ל

  • הערכת תיאורי תמונה

    בדיקה והשוואה של רמת הפירוט, ההזיות ואיכות הטקסט במודלי ראייה מול שיפוט אנושי קיים.

  • אימון מדדי שיפוט אוטומטיים

    פיתוח מדדים ממוחשבים שמטרתם לחקות הערכות אנושיות מסוג צד לצד עבור מודלי שפה וראייה.

  • בדיקת מודלי טקסט לתמונה

    שימוש בתיאורים העשירים כפרומפטים מורכבים להערכת יכולת הדיוק והספציפיות של מודלי יצירת תמונה.

איפה זה נופל

זה לא מאגר שמיועד לאימון מודלים מאפס, פשוט כי כמות הדגימות בו קטנה מאוד ורובן מיועדות לבנצ'מרק ולהערכה. כל התיאורים כתובים באנגלית בלבד, כך שאי אפשר להשתמש בו ישירות למשימות בעברית ללא תרגום. בנוסף, בחלק מהפיצולים התמונות מגיעות רק כקישורי אינטרנט או מפתחות, מה שעלול ליצור תלות בזמינות השרתים החיצוניים שבהם התמונות מאוחסנות בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, רישיון CC BY 4.0 מאפשר שימוש מסחרי מלא בנתונים. הדרישה המרכזית היא מתן קרדיט ברור למחברים וציון השינויים אם בוצעו.

האם יש במאגר תמיכה בעברית?

לא. הנתונים זמינים באנגלית בלבד. אם אתם צריכים תיאורים בעברית, תצטרכו לתרגם את הטקסטים בעצמכם.

כמה רשומות יש בכל המאגר ביחד?

יש בו קצת פחות מ־3,000 דגימות בסך הכל בחמשת החלקים. הפיצול הגדול ביותר מכיל 1,000 רשומות והקטן ביותר מכיל 100.

האם התמונות עצמן יושבות בתוך קובץ הנתונים?

חלק מהרשומות מספקות אובייקט תמונה וחלק מספקות רק כתובות רשת או מפתחות. מומלץ לבדוק את מבנה השדות בפיצול הספציפי שבו תרצו להשתמש.

איך טוענים

טוענים את הנתונים באמצעות הספרייה datasets ישירות מפייתון, תוך שימוש בפונקציה load_dataset והגדרת trust_remote_code כ־True בגלל קובץ הסקריפט הנלווה. אין צורך בטוקן גישה מיוחד. חובה לציין את שם התת-מאגר שרוצים לטעון, כמו IIW-400 או LocNar_Eval. המאגר מכיל רק כמה אלפי רשומות בסך הכל, והשדות מחזירים קישורים לתמונות ומחרוזות טקסט, כך שההורדה הראשונית מהירה ואינה דורשת משאבי אחסון כבדים.

from datasets import load_dataset

ds = load_dataset("google/imageinwords")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הנתונים, כל עוד מעניקים קרדיט מתאים ליוצרים המקוריים ומציינים אם נעשו שינויים. הוא אינו כופה עליכם לשחרר מודלים שאומנו עליו תחת אותו הרישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗