GPT
M

Mantis-Instruct

קוד פתוח

TIGER-Labapache-2.02024-02-24

  • multimodal
  • instruction-following
  • multi-image
  • lmm
  • vlm

מאגר הוראות מולטימודלי שמכיל 721 אלף דוגמאות של טקסט משולב בתמונות מרובות. הוא מתאים למי שרוצה ללמד מודל להשוות בין תמונות, להבין רצף זמנים ולבצע הסקה משותפת.

  • 5,228הורדות בחודש
  • 41לייקים

מה זה

המאגר כולל רשומות המשלבות פקודות טקסט עם יותר מתמונה אחת בכל דוגמה. הוא מחולק ל־14 תת-מאגרים שונים שמכוונים ליכולות ראייה והסקה מורכבות, כולל הבנת רצף זמני, פתרון שאלות על סמך הקשר והשוואה ויזואלית.

עשרה מתוך החלקים נלקחו ממאגרים קיימים כמו NLVR2, IconQA, ChartQA, DreamSim, Birds-to-Words, NExT-QA ו־STAR. ארבעת החלקים האחרים נבנו במיוחד עבור הפרויקט: LLaVA-665k-multi, LRV-multi, Contrast-Caption, ו־Multi-VQA שנוצר בעזרת פרומפטים ל־GPT-4.

המבנה הפנימי מכיל קובצי Parquet עבור הטקסט וההוראות, לצד קובצי ארכיון zip נפרדים של התמונות לכל תת-מאגר. השילוב הזה יוצר פיצול של הנתונים בין משימות ממוקדות תרשימים, השוואת תמונות וסרטונים שנחתכו לפרימי תמונה.

מתאים ל

  • השוואת תמונות מרובות

    אימון מודלים לזהות הבדלים דקים בין תצלומים עוקבים או דיאגרמות שונות.

  • הבנת רצף זמני מפריימים

    לימוד מודל להבין תהליכים ועלילה מתוך סדרת תמונות מתוך סרטוני וידאו.

  • מענה לשאלות על גרפים

    כוונון יכולות פענוח נתונים מתוך תרשימים ואינפוגרפיקה מרובת רכיבים ויזואליים.

איפה זה נופל

המאגר כולו באנגלית בלבד ואין בו שום תוכן בעברית. חלק מהמידע נוצר בצורה סינתטית על ידי מודל שפה מסחרי, מה שעלול להכניס הזיות או תבניות חוזרות שהמודל המקורי יצר. המפרסמים לא תיעדו תהליך סינון ידני או בדיקות רעילות והטיות עבור התמונות והטקסטים שנאספו. אם אתם בונים מערכת למוצר אמיתי, חובה לבדוק ידנית את איכות התיוגים בתת-המאגרים הסינתטיים לפני אימון מלא.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

הרישיון המוצהר של המאגר הוא apache-2.0, שמאפשר שימוש מסחרי חופשי. יחד עם זאת, תת-המאגר Multi-VQA נוצר באמצעות GPT-4, מה שעשוי להתנגש עם תנאי השימוש של OpenAI לגבי אימון מודלים מתחרים. מומלץ לבדוק את מקורות הנתונים של כל תת-מאגר לפני שימוש במוצר מסחרי.

האם יש במאגר דוגמאות בעברית?

לא. כל 721 אלף הדוגמאות וההוראות כתובות באנגלית בלבד. כדי לעבוד בעברית תצטרכו לתרגם את ההוראות או לאמן מודל שיודע לגשר בין שפות.

איך הנתונים נאספו ונבנו?

היוצרים שילבו עשרה מאגרי נתונים מוכרים מעולם הראייה הממוחשבת, והוסיפו עליהם ארבעה מאגרים חדשים. חלק מהדוגמאות החדשות הופקו על ידי כתיבת פרומפטים ישירות ל־GPT-4 כדי לייצר שאלות ותשובות על תמונות מרובות.

במה הוא שונה ממאגרי הוראות מולטימודליים רגילים?

רוב מאגרי ההוראות כוללים תמונה בודדת ושאלה עליה. המאגר הזה מתמקד כולו בהזנה של כמה תמונות ברצף בתוך אותה שיחה, כדי לפתח יכולות כמו השוואה, הצלבת מידע והבנת סדר כרונולוגי.

איך טוענים

טוענים את הנתונים דרך ספריית datasets תוך ציון שם תת-המאגר הספציפי שצריך. ברירת המחדל טוענת נתיבי תמונות מקומיים בלבד ומחייבת אתכם להוריד את קובצי ה־zip של התמונות ידנית מענף script ולעדכן נתיבים. אם משתמשים בגרסת datasets 2.18.0 אפשר להעביר את הפרמטר revision='script' כדי שהספרייה תוריד ותפרוס את התמונות אוטומטית למכונה המקומית. המאגר פתוח לציבור ואין צורך באישור גישה מיוחד.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/Mantis-Instruct")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה מחודשת, בתנאי ששומרים על הודעת הרישיון וזכויות היוצרים המקוריות. אין חובה לשתף מודלים שאומנו עליו באותו רישיון. עם זאת, ארבעה תת-מאגרים נוצרו בעזרת GPT-4 או מבוססים על מאגרים חיצוניים, ולכן תנאי השימוש של יוצרי התוכן המקורי עשויים להגביל אתכם בפועל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗