GPT
G

GRIT

קוד פתוח

zzliangms-pl2023-07-04

  • image-text-bounding-box pairs
  • image-text pairs

מאגר שמחבר בין ביטויים טקסטואליים למיקומים מדויקים של אובייקטים בתוך תמונות. הוא מיועד למי שמאמן מודלים מולטימודליים וזקוק ליכולת להצביע על אזורים ספציפיים ולא רק לתאר תמונה שלמה.

  • 834הורדות בחודש
  • 160לייקים

מה זה

המאגר מבוסס על צמדי תמונה וטקסט שנלקחו מתוך COYO-700M ומתוך LAION-2B. תהליך העיבוד חילץ מתוך התיאורים ביטויי שמות עצם באמצעות spaCy, וחיבר אותם לקואורדינטות של תיחום תמונה באמצעות GLIP. צמדים שלא נמצאו להם תיבות תיחום כלל הוסרו מהמאגר, כך שנותר סט מסונן שבו לכל תיאור יש לפחות אזור מעוגן אחד בתמונה.

כל רשומה במאגר מחזיקה מזהה ייחודי, כתובת אינטרנט של התמונה, מידות מקוריות, תיאור טקסטואלי וציוני דמיון של CLIP משני מודלים שונים. בנוסף, הרשומות כוללות רשימות מפורטות של קטעי הטקסט, מיקומי התווים שלהם בתוך המשפט, קואורדינטות מנורמלות של התיבה בתמונה וציון ביטחון של המודל שחזה אותה. המבנה הנוכחי במאגר כולל תיקייה בשם grit-20m שמחזיקה קובצי Parquet שונים המבוססים על COYO.

מתאים ל

  • אימון מודלי ביסוס טקסט

    חיבור מודלים שצריכים לזהות איזה חלק בתמונה שייך למילה או לביטוי ספציפי בטקסט.

  • זיהוי עצמים פתוח

    פיתוח מערכות ראייה ממוחשבת שמאתרות אובייקטים לפי תיאור חופשי ולא לפי רשימת קטגוריות סגורה.

  • הבנת ביטויים מתייחסים

    משימות שבהן המודל מקבל תיאור מורכב של אובייקט ומחזיר את המיקום המדויק שלו במרחב התמונה.

איפה זה נופל

התמונות עצמן אינן שמורות במאגר, ולכן חלק ניכר מהקישורים עלול להיכשל בעת ההורדה מאחר שאתרי מקור משתנים או נסגרים. הטקסט כולו באנגלית בלבד, ואין תמיכה בעברית או בשפות אחרות. מעבר לכך, כל תיבות התיחום והצימודים בין המילים לתמונות נוצרו באופן אוטומטי על ידי מודלים ולא עברו אימות ידני של בני אדם, מה שמכניס רעש מובנה וטעויות מיקום מובנות.

שאלות
נפוצות

האם התמונות עצמן נמצאות בתוך המאגר?

לא. המאגר מכיל רק קובצי Parquet עם כתובות URL, תיאורים וקואורדינטות. את התמונות צריך להוריד באופן עצמאי מהרשת באמצעות כלי כמו img2dataset.

האם יש במאגר נתונים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל התיאורים וביטויי המפתח חולצו מטקסטים באנגלית.

איך נוצרו תיבות התיחום של האובייקטים?

התיבות לא סומנו בידי בני אדם. התהליך חילץ שמות עצם באמצעות spaCy ולאחר מכן ניבא את מיקום התיבות והביטחון שלהן באמצעות מודל GLIP.

האם אפשר להשתמש בדאטהסט באופן מסחרי?

הרישיון המדווח הוא ms-pl, שדורש עמידה בתנאי הרישיון של מיקרוסופט. עם זאת, התמונות עצמן מגיעות מקישורים ברשת הפתוחה, כך שהזכויות עליהן כפופות לתנאים של אתרי המקור.

איך טוענים

המאגר אינו מכיל את קובצי התמונות עצמם אלא מטא-דאטה בלבד. כדי להשתמש בו צריך לשבט את המאגר באמצעות Git LFS, שמכיל קובצי Parquet דחוסים ב־snappy, ולאחר מכן להריץ כלי חיצוני כמו img2dataset כדי להוריד את התמונות ישירות מכתובות הרשת. אין צורך בבקשת גישה מיוחדת, אך תהליך ההורדה דורש רוחב פס משמעותי, זמן ריצה רב והתמודדות עם קישורים שבורים ברשת.

from datasets import load_dataset

ds = load_dataset("zzliang/GRIT")

הרישיון

הרישיון המדווח הוא רישיון Microsoft Public License, הידוע כ־ms-pl. רישיון זה מאפשר שימוש, שכפול והפצה, אך הוא כולל תנאים ברורים לגבי הפצת קוד המקור ומגבלות מסוימות על שימוש מסחרי ישיר בהתאם לנגזרות. בנוסף, מאחר שהתמונות יורדות מאתרים שונים ברחבי הרשת, יש לבדוק את זכויות היוצרים של התמונות המקוריות עצמן לפני שימוש בתוצרים מסחריים.

הרישיון המלא ב־Hugging Face ↗