GPT
L

Leopard-Instruct

קוד פתוח

wyu1apache-2.02024-10-29

  • multimodal
  • instruction-following
  • multi-image
  • lmm
  • vlm

מאגר הוראות לכוונון מודלי ראייה שפה, שמתמקד בריבוי תמונות עמוסות טקסט. הוא נבנה עבור משימות שדורשות קריאה והשוואה בין כמה מסמכים או מקורות חזותיים במקביל.

  • 102,138הורדות בחודש
  • 65לייקים

מה זה

המאגר כולל 925 אלף דוגמאות אימון להוראות, כאשר 739 אלף מתוכן מיועדות ישירות לתרחישים של ריבוי תמונות עם טקסט צפוף. הדאטה מבוסס על תתי קבוצות שונות, ביניהן חלוקה למקורות כמו מאמרים אקדמיים ממאגר arxiv ומקורות רשת דוגמת webvision. המבנה הפנימי כולל שדות של טקסטים ותמונות שמתאימים למעקב אחר הוראות חזותיות מורכבות.

הקוד במאגר מציג חלוקה לקונפיגורציות שונות שניתן לטעון בנפרד. הנתונים עצמם שימשו לאימון מודלים ייעודיים כמו Leopard-LLaVA וגם Leopard-Idefics2, כך שהפורמט מותאם ישירות לארכיטקטורות מולטי מודאליות שצריכות לנתח מידע טקסטואלי מתוך תמונות מרובות.

מתאים ל

  • אימון מודלי ראייה שפה

    כוונון מודלים מולטי מודאליים לביצוע הוראות מורכבות על גבי כמה תמונות ברצף.

  • ניתוח מסמכים ומאמרים

    חילוץ והשוואת מידע טקסטואלי מתוך צילומי עמודים מרובים ממקורות כמו מאמרי arxiv.

  • בדיקת יכולות OCR משולב

    בחינת יכולת ההבנה של מודל ראייה בתמונות רשת עמוסות פרטים וטקסט צפוף.

איפה זה נופל

המאגר מוגדר באנגלית בלבד. אין בו עברית, ולכן הוא לא מתאים לאימון ישיר של מודלים לקריאת מסמכים מקומיים. כרטיס המאגר לקוני מאוד ולא חושף את שיטות הסינון, רמת הדיוק של הטקסט שחולץ או הטיות אפשריות בבחירת התמונות. בנוסף, העבודה עם אלפי קבצי parquet והורדת נפח גדול של תמונות דורשת רוחב פס ואחסון משמעותי.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מסחרי?

כן. הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי מלא באימון מודלים ובמוצרים, כל עוד מקפידים על תנאי הייחוס של היוצרים.

האם יש במאגר תמיכה בעברית?

לא. המאגר מוגדר עבור השפה האנגלית בלבד, וכל המקורות המתועדים בו הם באנגלית. מודל שיאומן עליו בלבד לא ירכוש יכולות פענוח מסמכים בעברית.

איך בנוי המאגר מבחינת קבצים?

המאגר כולל מעל 2,160 קבצי parquet, שמחולקים לפי מקורות שונים כמו arxiv ורשת. ניתן למשוך אותו לפי קונפיגורציות נפרדות במקום להוריד את כל הדאטה יחד.

במה הוא שונה מדאטהסטים אחרים להוראות?

רוב המאגרים מתמקדים בתמונה בודדת עם תיאור קצר. המאגר הזה מתמקד במכוון בטקסטים צפופים שפרוסים על פני מספר תמונות בו זמנית.

איך טוענים

טוענים את הנתונים דרך ספריית datasets של Hugging Face, כשהיוצרים ממליצים במפורש לעבוד עם גרסה 2.18.0. הקבצים שמורים בפורמט parquet ומחולקים לאלפי קבצים קטנים, עם למעלה מאלפיים קבצים במאגר. המאגר ציבורי לחלוטין ואינו דורש אישור גישה מראש. השדות המרכזיים בכל רשומה הם images וטקסטים texts, ואפשר לטעון תת קבוצה ספציפית כמו webvision כדי להימנע מהורדה ועיבוד של כל התמונות בבת אחת.

from datasets import load_dataset

ds = load_dataset("wyu1/Leopard-Instruct")

הרישיון

הרישיון המדווח הוא apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של המאגר ושל מודלים שאומנו עליו, בלי חובה לשתף תחת אותו רישיון. התנאי המרכזי הוא מתן ייחוס מתאים ליוצרים ושמירה על הצהרות זכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗