GPT
V

visual_genome

קוד פתוח

ranjaykrishnacc-by-4.02022-04-21

מעל 108 אלף תמונות עם מיפוי צפוף של עצמים, יחסים ותיאורי אזורים. מחפשים אותו כשרצים לאמן מודלים על הבנה של קשרים בתמונה ולא רק על זיהוי פשוט של מה מופיע בה.

  • 593הורדות בחודש
  • 84לייקים

מה זה

המאגר מכיל 108,077 תמונות ומחבר בין ראייה ממוחשבת לשפה טבעית דרך רשת של עצמים ותכונות. המידע כולל 5.4 מיליון תיאורי אזורים, 1.7 מיליון שאלות ותשובות, 3.8 מיליון מופעי עצמים, 2.8 מיליון תכונות ומעל 2.3 מיליון קשרים מוגדרים בין אובייקטים. בממוצע תמצאו בכל תמונה 35 עצמים, 26 תכונות ו־21 יחסים ישירים ביניהם.

התיוג כולו הגיע מעבודת המונים דרך Amazon Mechanical Turk. יותר מ־33 אלף עובדים יצרו את התיאורים והקשרים לאורך שישה חודשים, אחרי תהליך פיתוח של יותר משנה שנועד לייצב את מבנה הנתונים. המושגים, שמות העצמים, התכונות והיחסים עברו האחדה והותאמו למזהים של WordNet synsets כדי לשמור על שפה אחידה.

מתאים ל

  • מענה על שאלות חזותיות

    אימון מערכות שמקבלות תמונה ושאלה באנגלית ומחזירות תשובה מדויקת שמבוססת על המידע באזורים שונים.

  • זיהוי יחסים בין עצמים

    פיתוח מודלים למיפוי גרף סצנה שמזהים איך אובייקט אחד משפיע על אחר בתמונה, כמו רכיבה או משיכה.

  • תיאור מקומי של אזורים

    יצירת טקסט תיאורי לתיחומים ספציפיים בתוך התמונה במקום תיאור כללי בלבד עבור כל הפריים.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין ייצוג לעברית. 93.02% מהמתייגים הגיעו מארצות הברית, והרוב המכריע שלהם היה בגילאי 25 עד 34, מה שמייצר הטיה ברורה של נקודת מבט מערבית ואופי שפה ספציפי. המאגר אינו מציע חלוקה מוגדרת למבחן או אימות, כך שאתם צריכים לפצל את המידע בעצמכם בצורה מדויקת לפני תחילת העבודה כדי למנוע דליפת מידע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט ברור למחברי המאגר לפי ההנחיות שלהם.

האם המאגר כולל תמיכה בעברית?

לא, כל השאלות, התשובות, התוויות ותיאורי האזורים נכתבו ונאספו באנגלית בלבד. אם תרצו להשתמש בו עבור מודלים בעברית תצטרכו לתרגם את הטקסטים בעצמכם.

כיצד נאספו התיוגים והקשרים בתמונות?

התיוג נעשה במיקור המונים דרך Amazon Mechanical Turk על ידי יותר מ־33,000 עובדים. הנתונים נאספו במסגרת של כ־800 אלף משימות שונות לאורך תקופה של שישה חודשים.

האם יש חלוקה מובנית לסט אימון ומבחן?

לא, המאגר מגיע כרגע עם סט אימון בלבד שמכיל את כל הרשומות. תצטרכו להפריד בעצמכם חלק מהתמונות לסט בדיקה כדי להעריך ביצועים בצורה אמינה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset עם ציון התצורה והגרסה, למשל region_description_v1.2.0. אין צורך באישור גישה מוקדם, אך כדאי לשים לב שכל הנתונים מוגדרים תחת סט אימון יחיד ללא חלוקה מובנית לסט מבחן. בעבודה מול שדה התמונה, ניגשים קודם לאינדקס הדגימה ורק אז לשדה עצמו כדי למנוע פענוח כבד ואיטי של קובצי תמונה ברקע.

from datasets import load_dataset

ds = load_dataset("ranjaykrishna/visual_genome")

הרישיון

הרישיון הוא Creative Commons Attribution 4.0 International. אפשר להשתמש במידע למטרות מחקריות ומסחריות, לשנות אותו ולבנות עליו מודלים חופשיים או מסחריים. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים, ללא חובה לשתף נגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗