GPT
L

LLaVA-CoT-100k

קוד פתוח

Xkevapache-2.02024-11-27

  • multimodal
  • reasoning
  • chain-of-thought
  • vlm

המאגר כולל עשרות אלפי שאלות ותשובות ויזואליות עם נימוקים מובנים צעד אחר צעד. הוא מתאים למי שרוצה לאמן מודל ראייה שפה לחשוב ולהסביר תמונות ולא רק לפלוט תשובה קצרה.

  • 1,681הורדות בחודש
  • 106לייקים

מה זה

הנתונים מחולקים לעשר קטגוריות שנאספו ממאגרים פתוחים קיימים. הבסיס הכללי נשען על ShareGPT4V עם 31.3 אלף דוגמאות, ChartQA עם 17.2 אלף ו־A-OKVQA עם 16.1 אלף. לצידם שולבו משימות מדעיות וממוקדות כמו AI2D ו־GeoQA פלוס עם 11.4 אלף כל אחת, ScienceQA עם 5.6 אלף, ודגימות קטנות יותר מ־DocVQA, PISC, CLEVR ו־CLEVR-Math.

המבנה של כל רשומה בקובץ train.jsonl מורכב ממזהה ייחודי, נתיב מקומי לקובץ התמונה ומערך שיחה. השאלה מגיעה ישירות מהמאגר המקורי תחת שדה האדם, והתשובה המנומקת תחת שדה ה־gpt נוצרה באמצעות GPT-4o כדי לספק הסבר רב שלבי מובנה לפתרון.

מתאים ל

  • אימון מודלי ראייה לחשיבה

    לימוד מודל להסביר צעד אחר צעד איך הגיע לתשובה על בסיס תמונה נתונה.

  • פענוח גרפים ותרשימים

    שיפור יכולת המודל לנתח נתונים מספריים ומבניים מתוך תרשימים וגרפים מורכבים.

  • פתרון בעיות גיאומטריה ומדע

    הקניית יכולות חישוב והסקה מדעית מתוך שאלות עם איורים ודיאגרמות.

איפה זה נופל

כל התשובות והנימוקים נוצרו בצורה סינתטית על ידי GPT-4o, כך שהמודל שתאמנו עלול לרשת הזיות או שגיאות היגיון של מודל המקור. היוצרים מודים בעצמם שעלולות להיות הטיות בנתונים למרות הניסיון לגוון.

המאגר כולו באנגלית בלבד ואין בו שום תוכן בעברית. בנוסף, חלוקת המקורות אינה אחידה, כך שנושאים כמו דיאגרמות ותרשימים מקבלים משקל כבד בהרבה ממסמכים טקסטואליים רגילים כמו DocVQA שמיוצגים רק בארבעת אלפים דוגמאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי בעמוד הוא apache-2.0 שמתיר שימוש מסחרי חופשי. למרות זאת, התשובות בדאטהסט נוצרו בעזרת GPT-4o, ותנאי השימוש של OpenAI מגבילים שימוש בפלט לאימון מודלים מסחריים. מומלץ להתייעץ משפטית לפני שמכניסים תוצר כזה לליבת מוצר.

האם יש במאגר שאלות או תמונות בעברית?

לא, הדאטהסט מוגדר באנגלית בלבד וכל השאלות והנימוקים כתובים בה. אם המטרה שלכם היא מודל שמסביר תמונות בעברית, תצטרכו לתרגם את הטקסטים בעצמכם או לבצע התאמה ייעודית. התמונות עצמן אוניברסליות אך הטקסט שבתוכן באנגלית.

איך נאספו הנתונים שבתוך המאגר?

היוצרים לקחו תמונות ושאלות מעשרה מאגרים פתוחים שונים כמו ChartQA, GeoQA פלוס ו־ShareGPT4V. את השאלות והתמונות הם הזינו ל־GPT-4o כדי לייצר תשובות מובנות עם הסבר רב שלבי. התוצאה היא שילוב של מידע קיים עם תוכן מנומק סינתטי.

איך מקבלים את התמונות בפועל?

התמונות אינן מגיעות כחלק מהטעינה של קובץ ה־JSONL. צריך להוריד ידנית תשעה עשר קבצים מפוצלים בעלי סיומת part מתוך המאגר. לאחר מכן מחברים אותם לקובץ זיפ יחיד במחשב ומחלצים את התיקייה לדיסק המקומי.

איך טוענים

טוענים את קובץ הטקסט ישירות עם datasets של Hugging Face דרך המזהה Xkev/LLaVA-CoT-100k ומקבלים את פיצול האימון. אין צורך באישור גישה מיוחד, אבל התמונות לא נטענות אוטומטית.

במאגר יש קובצי ארכיון מפוצלים מ־image.zip.part-aa ועד חלק ap. חייבים להוריד את כולם, לחבר אותם בפקודת cat אחת בקונסול, לחלץ את הזיפ ולהגדיר בקוד האימון את הנתיב המקומי לתמונות לצד שדות המזהה, התמונה והשיחות.

from datasets import load_dataset

ds = load_dataset("Xkev/LLaVA-CoT-100k")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה ללא דרישה לשתף את הנגזרות באותו רישיון. תנאי הרישיון דורשים מתן קרדיט ושמירה על הודעות זכויות היוצרים. עם זאת, התשובות נוצרו באמצעות GPT-4o, ולכן כדאי לבדוק את תנאי השימוש של OpenAI בנוגע לאימון מודלים מתחרים לפני שמשלבים את המודל המאומן במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗