GPT
G

GQA

קוד פתוח

lmms-lab-encodermit2023-12-26

גרסה ארוזה ומוכנה להערכה של מבחן GQA המוכר למודלי ראייה ושפה. אם אתם בודקים יכולות הסקה חזותית מורכבות במודל מולטימודלי, הפיצול הזה חוסך עבודת הכנה ידנית.

  • 36,464הורדות בחודש
  • 33לייקים

מה זה

המאגר כולל התאמה של דאטהסט GQA המקורי מבית סטנפורד לתוך תשתית ההערכה lmms-eval. המטרה המקורית של GQA היא לבדוק מענה על שאלות והסקה חזותית לגבי תמונות מהעולם האמיתי, תוך שימוש בגרפי סצנה כדי לדרוש שרשרת חשיבה ולא רק ניחוש לפי מתאמים סטטיסטיים.

בתוך המאגר הנתונים מפוצלים למספר ספריות של קובצי parquet, ביניהן חלוקה לפי challenge ו־submission. המבנה מחלק את המידע בין קובצי תמונות, כמו challenge_all_images, לבין קובצי הוראות ושאלות, כמו challenge_all_instructions וגרסאות balanced. הכרטיס הנוכחי לא מפרט את כמות הרשומות המדויקת בכל פיצול או את תהליך הסינון הנוסף שנעשה מעבר להמרה לפורמט של התשתית.

מתאים ל

  • הערכת מודלי ראייה ושפה

    הרצה ישירה בתוך כלי lmms-eval כדי לבדוק הסקה חזותית והבנת סצנה מול תוצאות ייחוס מוכרות.

  • בדיקת שרשראות הסקה

    מדידת הדיוק של מודל רב מודלי בשאלות שמחייבות כמה שלבי ניתוח של אותה תמונה.

  • בנצ׳מרק מהיר בתהליך פיתוח

    אימות שינויים בארכיטקטורה על גבי קובצי parquet מאורגנים בלי צורך לעבד מחדש את GQA.

איפה זה נופל

הכרטיס לא מספק מידע על מגבלות, הטיות ידועות או סינון תוכן שבוצע במהלך ההמרה. הנתונים מבוססים על מחקר מ־2019 והשפה היא אנגלית בלבד, כך שאין כאן תמיכה בעברית או בהקשרים תרבותיים מקומיים. מי שמתכנן להשתמש בזה למערכת ייצור צריך לזכור שמדובר בבנצ׳מרק סגור להערכה ולא במאגר שמשקף שאלות פתוחות של משתמשים חיים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקטים מסחריים?

כן, הרישיון המדווח במאגר הוא MIT שמאפשר שימוש מסחרי מלא. אתם יכולים להעריך מודלים פנימיים או מסחריים בלי דרישה לחשוף את הקוד שלכם. חובה רק לשמור על הקרדיט והודעת הרישיון המקורית בקבצים.

האם יש כאן שאלות או תיוגים בעברית?

לא, המאגר מבוסס כולו על GQA המקורי ומכיל אנגלית בלבד. אם המוצר שלכם מיועד לשוק המקומי, תצטרכו לתרגם את השאלות או לבנות מבחן ייעודי משלכם. הסקה חזותית בעברית דורשת התאמות שלא קיימות כאן.

מה ההבדל בין המאגר הזה לבין GQA המקורי מסטנפורד?

מדובר באותם נתונים בסיסיים, אך הם ארוזים מחדש בקובצי parquet כדי לעבוד ישירות עם ספריית lmms-eval. החלוקה לתמונות והוראות נפרדות מאפשרת טעינה מודולרית נוחה דרך פייתון. במקום להוריד קובצי json ותמונות גולמיות מהאתר המקורי, מקבלים מבנה שמתאים להערכה בלחיצה אחת.

איך הנתונים נאספו ונבנו במקור?

המאגר מבוסס על המאמר של הדסון ומנינג מ־2019 שבו ניתחו תמונות אמיתיות ויצרו גרפי סצנה מפורטים. השאלות נבנו על בסיס אותם גרפים כדי לחייב הבנה מרחבית וקשרים בין עצמים. המפרסמים הנוכחיים רק המירו את הקבצים הללו למבנה נתונים מודרני.

איך טוענים

אתם מושכים את הקבצים ישירות דרך ספריית datasets או כחלק מהרצת lmms-eval. המאגר מכיל 87 קבצים בפורמט parquet המחולקים לפי תמונות ושאלות, ללא צורך באישור גישה מיוחד או חתימה על הסכמים. לפני שאתם מורידים, קחו בחשבון שיש כאן חבילות מרובות של תמונות שדורשות נפח אחסון פנוי וזמן פריקה, וששדות המפתח מחברים בין מזהה השאלה לבין קובץ התמונה המתאים.

from datasets import load_dataset

ds = load_dataset("lmms-lab-encoder/GQA")

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה והטמעה בקוד סגור, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין חובה לשתף נגזרות באותו רישיון, כך שאימון או בדיקה של מודלים פנימיים לא מחייבים חשיפה של התוצרים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗