GPT
M

M3IT

קוד פתוח

MMInstructionother2023-05-04

מאגר ענק לכוונון מודלים מולטימודליים לפי הוראות, שמאחד עשרות משימות ראייה ושפה קלאסיות. הוא מתאים למי שרוצה לאמן מודל מולטימודלי על הוראות מגוונות בלי לאסוף ולהמיר בעצמו עשרות מקורות שונים.

  • 4,179הורדות בחודש
  • 136לייקים

מה זה

המאגר מאגד מגוון רחב של משימות ראייה ושפה קלאסיות שהומרו למבנה אחיד של שיחה והוראות. בין המשימות נכללים תיאור תמונות, סיווג, מענה על שאלות חזותיות, שאלות הדורשות ידע חיצוני, היסק לוגי, יצירת טקסט מותנה, משימות ייעודיות בסינית וכן משימות המבוססות על וידאו. כל דוגמה מכילה הוראה מילולית, קלט טקסטואלי, פלט מבוקש ומערך של תמונות המקודדות כמחרוזות בפורמט בייס שישים וארבע.

מקורות הנתונים הם מאגרים אקדמיים מוכרים שנאספו לאורך השנים, כגון קוקו, אימג'נט, דוק וי קיו איי, וי סי אר, וסיאנס קיו איי. שמונה סטודנטים לתארים מתקדמים, שהם מחברי המאמר, ניסחו ארבע מאות הוראות שונות כדי לכסות את המשימות. תהליך העבודה כלל ניסוח הוראות לכל משימה, האחדת מבנה הנתונים והתמונות לסכמה משותפת, בקרת איכות על התוצרים ותרגום מאגרי מפתח לשפות נוספות.

מתאים ל

  • אימון מודל ראייה ושפה

    כוונון מודלים מולטימודליים לפי הוראות במגוון רחב של משימות חזותיות.

  • הערכת יכולות הבנת מסמכים

    בדיקת ביצועי מודל במענה על שאלות מתוך תמונות טקסט ומסמכים סרוקים.

  • הסקה חזותית מורכבת

    אימון ושיפור מודלים בפתרון בעיות היסק רב שלבי על בסיס תמונות.

איפה זה נופל

המאגר מתבסס רק על אנגלית וסינית בגרסה הראשית שלו, ללא עברית כלל. התמונות והטקסטים נלקחו ממאגרי עבר מוכרים, מה שאומר שההטיות ההיסטוריות של אותם מאגרים, כמו ייצוג תרבותי מוטה או איכות תמונות מוגבלת, עוברות ישירות לכאן. בנוסף, קידוד התמונות בבייס שישים וארבע בתוך קובצי הטקסט מנפח את השימוש בזיכרון בזמן הטעינה ומחייב עיבוד מוקדם. לא מפורט מנגנון סינון אוטומטי של תכנים רגישים מעבר לבקרת האיכות הידנית של המחברים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

ההוראות עצמן זמינות תחת רישיון פתוח, אך נתוני הבסיס כפופים לרישיונות המקוריים של עשרות המאגרים השונים. חלק מהמקורות אינם מתירים שימוש מסחרי או מוגדרים תחת רישיון לא ידוע. חובה לבדוק את תנאי המקור של כל תת מאגר שבו אתם משתמשים לפני אימון מודל מסחרי.

האם המאגר כולל תמיכה בעברית?

לא, המאגר הראשי מכיל נתונים באנגלית ובסינית בלבד. קיים מאגר נפרד בשם אם שלוש איי טי שמונים שכולל תרגומים לשפות נוספות, אך עמוד המאגר הנוכחי אינו מכיל נתונים בעברית.

באיזה פורמט נשמרות התמונות במאגר?

התמונות אינן מגיעות כקבצי תמונה נפרדים אלא כמחרוזות טקסט בקידוד בייס שישים וארבע בתוך שדה ייעודי. המשמעות היא שקוד הטעינה שלכם חייב לכלול פענוח של המחרוזת והמרתה בעזרת ספריית עיבוד תמונה כדי לחלץ את הפיקסלים.

איך המאגר הזה נאסף ונבנה?

החוקרים לקחו עשרות מאגרי ראייה ושפה קיימים והמירו אותם למבנה אחיד של הוראה, קלט ופלט. שמונה סטודנטים לתארים מתקדמים ניסחו ארבע מאות תבניות הוראה שונות וביצעו בקרת איכות ידנית על התוצרים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס של האגינג פייס באמצעות הפונקציה לוד דאטהסט, כאשר מעבירים את שם תת המאגר הרצוי, למשל קוקו. הגישה פתוחה לחלוטין ואינה דורשת אישור מיוחד, אך ניתן להשתמש בטוקן גישה של האגינג פייס במידת הצורך. כל רשומה כוללת את השדות אינסטרקשן, אינפוטס, אאוטפוטס, ואימג' בייס שישים וארבע אס טי אר. שים לב שהתמונות שמורות כטקסט מקודד, ולכן צריך לפענח אותן בזיכרון ולהמיר לאובייקט תמונה לפני ההזנה למודל.

from datasets import load_dataset

ds = load_dataset("MMInstruction/M3IT")

הרישיון

ההוראות שנוספו על ידי המחברים מופצות תחת רישיון קריאייטיב קומונס ייחוס ארבע אפס, שמתיר שימוש מסחרי בכפוף למתן קרדיט. עם זאת, התמונות והטקסטים המקוריים שומרים על הרישיונות הנפרדים של כל מאגר מקור. חלק מהמאגרים כוללים רישיונות לא ידועים או מגבלות לשימוש מחקרי בלבד, כך שלא ניתן להניח שהמאגר כולו מותר לשימוש מסחרי ללא בדיקת המקורות הספציפיים.

הרישיון המלא ב־Hugging Face ↗