GPT
C

ahmed-masry/ChartQA

קוד פתוח

ahmed-masrygpl-3.02023-09-21

מענה על שאלות שמבוססות על תרשימים ודורשות שילוב של ראייה ממוחשבת והיגיון לוגי. מתאים למי שבונה מודלים שמנתחים גרפים ולא רק טקסט פשוט.

  • 4,088הורדות בחודש
  • 32לייקים

מה זה

המאגר כולל נתונים להערכה ואימון של הבנת תרשימים, עם חלוקה מובנית לקובצי רכבת, אימות ומבחן בפורמט פארקט לצד קובץ ארכיון דחוס. לפי מאמר המקור מ־ACL 2022, המטרה היא להעמיד מדד לבחינת יכולות של הסקת מסקנות ויזואלית ולוגית מתוך גרפים, ולא רק פענוח בסיסי של טקסט מתוך תמונה.

בפועל המאגר מכיל שמונה קבצים, כולל שלושה קובצי אימון, קובץ בדיקה, קובץ ולידציה וקובץ זיפ ייעודי בשם ChartQA Dataset.zip שמחזיק את התמונות עצמן. כרטיס הדאטהסט לא מפרט את אופן איסוף הגרפים, תהליך הסינון או כמות השאלות המדויקת, ולכן לפרטים המלאים על מקורות המידע יש לפנות למאמר המקורי של מסרי ושותפיו.

מתאים ל

  • בנצ'מרק למודלי שפה ויזואליים

    בדיקת יכולת המודל להבין גרפים, לזהות מגמות ולענות על שאלות לוגיות מורכבות.

  • אימון מודלים להבנת תרשימים

    שיפור ביצועים של מודלי ראייה ממוחשבת בפיענוח נתונים מתוך אינפוגרפיקה ותרשימים.

  • מחקר אקדמי בהסקה ויזואלית

    השוואת ביצועים מול מאמר המקור שפורסם ב־ACL 2022 תחת תנאי מחקר פתוחים.

איפה זה נופל

הכרטיס בהאגינג פייס כמעט ריק ואינו מציין שפות, מגבלות תוכן או הטיות שקיימות בנתונים. ההסתמכות היא על תרשימים באנגלית בלבד ללא שום התייחסות לעברית או תמיכה בטקסט מימין לשמאל. אם אתם בונים משהו שצריך לקרוא דוחות כספיים מקומיים או ממשקים בעברית, הנתונים כאן לא יעזרו. בנוסף, חוסר היכולת לטעון את התמונות בצורה אוטומטית יוצר סרבול טכני שדורש פיתוח סקריפטים נפרדים לפריסה וקישור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הוא GPL 3.0, מה שאומר שכל נגזרת חייבת להשתחרר גם היא תחת אותו רישיון פתוח. לרוב צוותי פיתוח מסחריים נמנעים משימוש בו למוצרים סגורים מחשש לפגיעה בקניין הרוחני.

האם אפשר להשתמש בו לתרשימים בעברית?

הכרטיס לא מזכיר תמיכה בעברית והמאגר מתמקד באנגלית. תרשימים מקומיים שנכתבים מימין לשמאל לא מקבלים כאן מענה.

למה אי אפשר לטעון אותו ישירות בקוד?

קובצי הפארקט מופרדים מקובץ התמונות הראשי. היוצר דורש הורדה ידנית של קובץ הזיפ מטאב הקבצים כדי להצמיד את התמונות לנתונים.

איך נאספו התרשימים והשאלות?

המידע הזה אינו מופיע בעמוד הדאטהסט עצמו. כדי להבין את מקורות הנתונים ושיטות הדגימה, יש לקרוא ישירות את המאמר האקדמי שפורסם בכנס ACL 2022.

איך טוענים

אי אפשר להשתמש בפקודת load_dataset הרגילה של ספריית datasets כדי לטעון את הכול ישירות. היוצר מבהיר שחובה להוריד ידנית את קובץ הזיפ מטאב הקבצים כדי לקבל את תמונות התרשימים. יש גרסה חלופית ברשת שנטענת ישירות בקוד אבל היא מגיעה בלי התמונות, כך שעדיין תצטרכו להוריד ולחבר אותן לקובצי הפארקט של האימון והמבחן בעצמכם.

from datasets import load_dataset

ds = load_dataset("ahmed-masry/ChartQA")

הרישיון

הרישיון המדווח הוא GPL 3.0. זהו רישיון קוד פתוח עם דרישת שיתוף זהה שמחייבת שחרור קוד ומודלים נגזרים תחת אותו רישיון בדיוק. שימוש מסחרי סגור בעייתי מאוד תחת התנאים האלה, וחברות מסחריות שרוצות לשמור על קוד סגור יצטרכו לבחון היטב אם אימון מודל עליו חושף אותן לדרישות הרישיון.

הרישיון המלא ב־Hugging Face ↗