GPT
P

PangeaInstruct

קוד פתוח

neulabapache-2.02024-10-19

  • multilingual
  • multimodal

מאגר ענק של 6.45 מיליון דוגמאות אימון למודלי ראייה שפה בפורמט LLaVA. הוא נועד למי שרוצה ללמד מודל מולטי מודלי לענות על שאלות ולהבין תמונות בפריסה של עשרות שפות ותרבויות שונות.

  • 2,473הורדות בחודש
  • 87לייקים

מה זה

המאגר מכיל 6,450,624 רשומות שמיועדות לשלב ה instruction tuning של מודלים מולטי מודליים. המידע אינו מקור בודד אלא הרכבה של מעל שלושים מקורות ודאטהסטים קיימים, המחולקים למספר קטגוריות ראשיות: משימות כלליות, תיאורי תמונות, הבנת מסמכים וגרפים, זיהוי טקסט בתמונה, תרגום, ודוגמאות טקסטואליות טהורות של קוד ומתמטיקה.

חלק משמעותי מוקדש לתכנים תרבותיים, כולל מעל מיליון שאלות ותשובות שנוצרו על בסיס LAION. לצד אלה תמצאו תת מאגרים מוכרים כמו ChartQA, ShareGPT4V, OpenHermes וכן סטים ייעודיים לשפות שונות כמו וייטנאמית, אורדו, יפנית וסינית. הפורמט של הרשומות עוקב אחרי המבנה המקובל של LLaVA, עם קובצי מטא דאטה בפורמט JSON ותמונות נלוות.

מתאים ל

  • אימון מודלי VLM רב לשוניים

    כוונון הוראות של מודלי ראייה שפה שצריכים להבין תמונות ולענות על שאלות במגוון שפות רחב.

  • הבנת מסמכים וגרפים

    שיפור היכולת של מודל לפענח תרשימים, טבלאות ומסמכים סרוקים בעזרת סטים ייעודיים כמו ChartQA ו DocVQA.

  • שימור יכולות שפה וקוד

    ערבוב דוגמאות טקסט של מתמטיקה וקוד יחד עם משימות מולטי מודליות כדי למנוע שכחה קטסטרופלית בזמן האימון.

איפה זה נופל

חלק ניכר מהנתונים מבוסס על תיוגים סינתטיים וקובצי שאלות ותשובות שנוצרו על ידי מודלים כמו LLaVA ולא על ידי בני אדם. למרות שבדגל המאגר מופיע דגל ישראל ויש ייצוג רשמי ל 39 שפות, תגיות השפה במאגר כוללות רשימה מצומצמת בהרבה ועברית אינה מופיעה בהן באופן מובהק. אם המטרה שלכם היא דיוק מקצועי במסמכים בעברית או תרבות מקומית, אל תבנו על המאגר הזה בלי לבדוק לעומק מה בדיוק חלחל אליו מתת המאגרים השונים.

שאלות
נפוצות

האם המאגר כולל עברית?

דגל ישראל מופיע בעמוד הפרויקט כאחת מ 39 השפות הנתמכות במודל Pangea, אך ברשימת השפות הרשמית של הדאטהסט עברית אינה מתועדת. ככל הנראה יש ייצוג קטן בלבד שמקורו בדאטהסטים רב לשוניים כלליים, ולא מאגר ייעודי.

האם מותר להשתמש בדאטהסט לצרכים מסחריים?

הרישיון המוצהר של המאגר הוא Apache 2.0 שמתיר שימוש מסחרי. יחד עם זאת, המאגר מורכב משילוב של מקורות רבים, שחלקם כוללים מידע שנוצר באמצעות GPT4V ומקורות רשת אחרים, מה שעלול לייצר מגבלות משפטיות עקיפות.

מה הגודל של הדאטהסט ואיך מורידים אותו?

מדובר ב 6.45 מיליון דוגמאות המחולקות ל 90 קבצים שכוללים ארכיוני תמונות דחוסים וקובצי JSON. ההורדה דורשת הרצת סקריפט ייעודי שמוריד את הקבצים מ Hugging Face, איחוד קובצי tar שפוצלו לחלקים, וחילוץ ידני שלהם למערכת הקבצים.

מאיפה הגיעו הנתונים?

החוקרים אספו ואיחדו מעל שלושים דאטהסטים קיימים בתחום הראייה והשפה. התמהיל כולל סטים מוכרים כמו Cambrian, ShareGPT4V ו LLaVA NeXt, יחד עם נתונים תרבותיים מ LAION וסטים ממוקדים לשפות אסייתיות.

איך טוענים

אין כאן טעינה פשוטה של שורה אחת דרך הספרייה הרגילה של Hugging Face. המאגר כולל תשעים קבצים שונים, כאשר המטא דאטה המרכזית יושבת בקובץ PangeaIns.json והתמונות מפוזרות בארכיוני tar ו zip בתוך התיקיות השונות. חלק מארכיוני התמונות הגדולים, כמו בתיקיית התרבות, חולקו מראש למספר חלקים בקובצי part. כדי לעבוד איתם תצטרכו להוריד את הקבצים באמצעות הסקריפט של huggingface_hub, לאחד את החלקים בפקודת cat ורק אז לחלץ את התמונות לדיסק.

from datasets import load_dataset

ds = load_dataset("neulab/PangeaInstruct")

הרישיון

המאגר מדווח תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הקוד והנתונים, בכפוף למתן קרדיט וצירוף עותק הרישיון. עם זאת, הדאטהסט מאגד בתוכו עשרות מקורות חיצוניים, כולל דאטהסטים מבוססי מודלים מסחריים כמו GPT4V, כך שמומלץ לבדוק את הרישיונות של תת המאגרים עצמם לפני שמשלבים מודל שאומן עליהם במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗