GPT
T

the_cauldron

קוד פתוח

HuggingFaceM4רישיון לא דווח2024-04-11

אוסף ענק של חמישים מאגרי תמונה וטקסט שרוכזו יחד לאימון מודלים רב מודליים. המטרה היא לקבל מגוון רחב של משימות ראייה ושיחה בפורמט אחיד בלי לאסוף כל מקור בנפרד.

  • 219,577הורדות בחודש
  • 557לייקים

מה זה

המאגר כולל איחוד של חמישים מאגרי ראייה ושפה שונים ששימשו לכוונון של המודל Idefics2. כל רשומה בנויה מאותו מבנה בדיוק, רשימת תמונות מסוג PIL ורשימת חילופי דברים בשיחה בין משתמש לעוזר שמתייחסת לתמונות האלה, כולל ציון המקור של השאלה.

המקורות מחולקים לפי תתי מאגרים שונים וכוללים משימות מגוונות. תמצאו שם שאלות ותשובות כלליות על תמונות כמו VQAv2 או COCO-QA, תיאורי תמונות כמו LNarratives, וכן משימות של זיהוי טקסט, מסמכים ותרשימים כמו ai2d ו־chartqa. כל החלקים מביאים רק את סטים של האימון מהמקורות המקוריים.

מתאים ל

  • כוונון מודלי ראייה ושפה

    אימון ופיין טיונינג של מודלים רב מודליים שמנתחים תמונות ומנהלים עליהן שיחה בפורמט אחיד.

  • הבנת תרשימים וגרפים

    טעינת תת המאגרים כמו chartqa או ai2d לאימון מודל לענות על שאלות מתוך שרטוטים.

  • יצירת כתוביות לתמונות

    שימוש במקורות הכיתוב כמו LNarratives לאימון מודלים שמסבירים מה מופיע בתוך תמונה.

איפה זה נופל

הכרטיס מציג רק את סטי האימון של המקורות, כך שאין כאן סטים של ולידציה או מבחן להערכה. לא מדווח בכרטיס על תמיכה בעברית, והדוגמאות והמקורות המפורטים באנגלית. בנוסף, מדובר בהדבקה של עשרות מאגרים שונים שנאספו במקור לצרכים שונים, בלי פירוט בכרטיס על סינון שבוצע מעבר לפורמט האחיד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מוגדר רישיון בדף המאגר. מאחר שהוא מורכב מחמישים מקורות שונים, אי אפשר להניח שמותר להשתמש בו מסחרית בלי לבדוק את הרישיון המקורי של כל תת מאגר שאתם טוענים.

האם המאגר כולל עברית?

הכרטיס לא מדווח על נתונים בעברית. המאגרים המפורטים בו הם מקורות מוכרים באנגלית, והדוגמאות כוללות טקסט באנגלית בלבד.

איך ניגשים לחלק מסוים מתוך המאגר?

לא חייבים למשוך את כל 940 הקבצים יחד. בשימוש בפקודת הטעינה בפייתון מגדירים את שם הקונפיגורציה הרצויה, למשל chartqa או aokvqa, ומורידים רק את החלק הזה.

האם יש בו חלוקה לסט בדיקה והערכה?

לא. הכרטיס מציין במפורש שהאוסף כולל אך ורק את סטי האימון של המאגרים המקוריים, כך שתצטרכו מקורות נפרדים כדי לבדוק ביצועים.

איך טוענים

טוענים אותו דרך ספריית datasets הרגילה של פייתון בפקודה load_dataset, כשמעבירים את שם המאגר יחד עם שם התת מאגר הספציפי שרוצים, למשל ai2d. אין צורך באישור גישה מיוחד כדי להוריד. המידע שמור בקובצי parquet שמחולקים לפי תת מאגר, ויש 940 קבצים כאלה בסך הכל. השדות שמעניינים אתכם בקוד הם images שמכיל את התמונות ו־texts שמכיל את התורות בשיחה.

from datasets import load_dataset

ds = load_dataset("HuggingFaceM4/the_cauldron")

הרישיון

לא דווח רישיון בכרטיס המאגר. המשמעות היא שאין הרשאה ברורה ומפורשת לשימוש מסחרי או חופשי, ובגלל שהאוסף מאחד חמישים מאגרים שונים, לכל אחד מהם עשויים להיות תנאי שימוש וזכויות יוצרים משלו שחובה לבדוק במקור לפני שמאמנים עליו מודל.

הרישיון המלא ב־Hugging Face ↗