GPT
L

LLaVA-NeXT-Data

קוד פתוח

lmms-labרישיון לא דווח2024-08-08

תערובת נתונים לאימון מודלי ראייה שפה, שמיועדת לשפר יכולות OCR, ניתוח מסמכים והבנת תרשימים. מי שבונה מודל מולטימודלי ימצא כאן דוגמאות מגוונות מבוססות הנחיות משתמש ותשובות של מודלים חזקים.

  • 3,951הורדות בחודש
  • 47לייקים

מה זה

המאגר כולל כ־779 אלף רשומות ששימשו לשלב ה־instruction tuning של דגמי LLaVA-NeXT. הרשומות מורכבות ממזהה, תמונה ושיחות מרובות תורות. המטרה של האוצרים היתה לשפר את יכולות השיחה הוויזואלית ולהרחיב את ההבנה של טקסט בתוך תמונה לעומת LLaVA-1.5.

מקורות המידע משלבים דאטה קודם שנוצר עם מודלי GPT ויזואליים, כולל LAION-GPT-V ו־ShareGPT-4V. כדי לחזק OCR והבנת מסמכים הוסרו תמונות TextCaps והוחלפו ב־DocVQA וב־SynDog-EN. להבנת גרפים ותרשימים נוספו דוגמאות מתוך ChartQA, DVQA ו־AI2D.

הצוות אסף במקור גם 15 אלף דוגמאות מבקשות משתמשים אמיתיים בדמו של LLaVA עם תשובות GPT-4V, אך חלק זה הושמט מהמאגר הפומבי בגלל שיקולי רישוי ומדיניות פרטיות.

מתאים ל

  • אימון מודל ראייה שפה

    שימוש בתערובת המוכנה כדי לבצע שלב instruction tuning למודלים מולטימודליים פתוחים.

  • שיפור OCR במסמכים

    חילוץ הדוגמאות של DocVQA ו־SynDog-EN לצורך חיזוק יכולות קריאת טקסט באנגלית מתוך תמונות.

  • הבנת גרפים ותרשימים

    אימון רכיבים ייעודיים לפענוח תרשימים באמצעות חלקי הנתונים של ChartQA ו־DVQA.

איפה זה נופל

הנתונים קיימים באנגלית ובסינית בלבד, ללא ייצוג לשפות אחרות וללא עברית. אי אפשר לאמן ממנו מודל שיבין מסמכים ישראליים מקומיים בלי תוספת דאטה ייעודי. בנוסף, חלקי מידע שנאספו מאינטראקציות אמיתיות עם הדמו נחתכו החוצה, כך שנותרו בעיקר מאגרי עבר סינתטיים ודאטהסטים מובנים. חלק ניכר מהתשובות נוצר על ידי GPT-4V, מה שמחייב בדיקה של הזיות ותלות במדיניות השימוש של OpenAI.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

לא מומלץ בכלל. למרות ציון של רישיון Apache 2.0 בטקסט, יוצרי המאגר כתבו במפורש שהשימוש מותר למחקר אקדמי ולחינוך בלבד. בנוסף, יש בו נתונים שנוצרו על ידי מודלים של OpenAI, מה שמוסיף מגבלות שימוש מסחריות.

האם יש בדאטהסט תוכן בעברית?

לא. הכרטיס מצהיר על שתי שפות בלבד, אנגלית וסינית. כדי להביא מודל לביצועים סבירים בעברית צריך לאסוף ולתרגם נתונים ממקורות חיצוניים.

מה קרה ל־15 אלף הדוגמאות של משתמשי הדמו?

היוצרים החליטו לא לשחרר אותן לציבור מטעמי פרטיות, רישוי ומדיניות. המאגר שפורסם מכיל רק את שאר חלקי התערובת, שמסתכמים בכ־779 אלף שורות.

איך טוענים

טוענים את הנתונים באמצעות הספרייה הרגילה של Hugging Face בפקודת load_dataset עבור הפיצול train. המאגר מחולק ל־250 קובצי Parquet נפרדים, והוא זמין גם בפורמט גולמי של תיקיית תמונות וקובץ JSON. כל רשומה כוללת את השדות id, image ו־conversations. אם מתאמנים בסביבה שמצפה למבנה הקבצים המקורי של LLaVA, צריך לחלץ ולשמור את התמונות לדיסק ולבנות מחדש קובץ JSON עם הנתיבים המתאימים.

from datasets import load_dataset

ds = load_dataset("lmms-lab/LLaVA-NeXT-Data")

הרישיון

במטא-דאטה לא דווח רישיון באופן מוסדר, אך בגוף הכרטיס הצוות מציין Apache 2.0 ומייד מגביל את השימוש למחקר אקדמי ולחינוך בלבד. הסתירה הזו אומרת ששימוש מסחרי מסוכן מאוד עד בלתי אפשרי. בנוסף, קיומו של תוכן שנוצר על ידי GPT-4 מחייב ציות לתנאי השימוש של OpenAI, שאוסרים אימון מודלים מתחרים.

הרישיון המלא ב־Hugging Face ↗