GPT
C

CharXiv

קוד פתוח

princeton-nlpcc-by-sa-4.02024-06-10

  • chart-understanding
  • chart-reasoning
  • scientific-figure
  • multimodal-large-language-models
  • chart

מאגר של תרשימים מדעיים מורכבים לבדיקת מודלים רב מודליים. מומחים אנושיים יצרו לכל תרשים שאלות תיאור והסקה שקשה לפתור בניחוש פשוט.

  • 9,266הורדות בחודש
  • 51לייקים

מה זה

המאגר מבוסס על 2,323 תרשימים ברזולוציה גבוהה שנאספו ידנית מתוך מאמרי arXiv. בניגוד למאגרי גרפים סינתטיים שנראים מושלם מדי, כאן מדובר בגרפים אמיתיים שחוקרים שמו במאמרים שלהם, עם כל העומס והגופנים הקטנים.

לכל תרשים הוצמדו חמש שאלות עם תשובות קצרות. ארבע שאלות תיאוריות, כאשר אחת מהן אינה ניתנת למענה מתוך התרשים בכוונה, ועוד שאלת הסקה מורכבת שדורשת הבנה של הנתונים. המבנה הזה נועד לבדוק אם המודל מזהה פרטים ויודע גם להודות כשמידע חסר.

המאגר כולל גם קובצי הערכות קיימות של מודלים מוכרים כמו Claude 3.5 Sonnet, Cambrian ו־ChartGemma, כך שאפשר להשוות תוצאות ישירות מול הרצות קודמות.

מתאים ל

  • הערכת מודלים רב מודליים

    בדיקת יכולת המודל לפענח תרשימים מדעיים מורכבים ועמוסים ממאמרים אמיתיים.

  • בדיקת הזיות בתרשימים

    בחינה אם המודל יודע לזהות מתי שאלה על גרף אינה ניתנת למענה ולא להמציא נתונים.

  • השוואת ביצועי הסקה מול תיאור

    מדידת הפער ביכולת של מודל ראייה לחלץ מידע פשוט לעומת הסקת מסקנות מהנתונים.

איפה זה נופל

זהו כלי הערכה בלבד ולא מקור לאימון. היוצרים אוסרים במפורש להשתמש בו לאימון מודלים, ולכן הוא לא יעזור למי שמחפש לשפר מודל קיים אלא רק למי שבוחן ביצועים. כל התוכן באנגלית ומגיע מעולם הפרסומים האקדמיים, ללא תרשימים בעברית או תרשימים עסקיים נפוצים. בנוסף, יש שגיאות אנושיות נקודתיות בתיוג שהקהילה כבר מצאה בחלק מהרשומות.

שאלות
נפוצות

האם מותר לאמן מודלים על הדאטהסט הזה?

לא. יוצרי המאגר אוסרים במפורש על שימוש בנתונים לצורך אימון מודלים. המאגר מיועד אך ורק להערכה ובדיקת ביצועים של מודלים קיימים.

האם יש תמיכה בעברית?

לא. כל התרשימים מגיעים ממאמרים ב־arXiv וכל השאלות והתשובות מנוסחות באנגלית בלבד.

מאיפה הגיעו התרשימים ואיך מאמתים אותם?

התרשימים נאספו ידנית ממאמרי arXiv. כל תרשים מקושר במסד הנתונים למזהה המאמר המקורי תחת השדה original_id, כך שניתן לבדוק את ההקשר המדעי המלא.

האם אפשר להשתמש בתוצאות להשוואה ישירה מול מודלים אחרים?

כן. המאגר כולל תיקיית הערכות קיימות עם תוצאות ריצה מוכנות של מודלים כמו Claude 3.5 Sonnet ואחרים, מה שמאפשר להשוות את הביצועים מולם ישירות באותם תנאים.

איך טוענים

טוענים את הנתונים ישירות דרך Hugging Face ללא צורך בבקשת גישה מיוחדת. אם משתמשים בקוד ההערכה הרשמי של החוקרים, מורידים בעיקר את קובץ images.zip המרוכז שמכיל את התמונות. המאגר מכיל 240 קבצים כולל תוצאות הרצה מוכנות בפורמט JSON. השדות המרכזיים כוללים את שאלות התיאור וההסקה, התשובות הקצרות, ואת מזהה המקור של המאמר המדעי.

from datasets import load_dataset

ds = load_dataset("princeton-nlp/CharXiv")

הרישיון

השאלות עצמן מופצות תחת רישיון CC BY-SA 4.0 שדורש ייחוס ושיתוף תחת אותו רישיון אם אתם מפיצים נגזרות. עם זאת, זכויות היוצרים על התרשימים עצמם שייכות למחברי המאמרים המקוריים ב־arXiv, ויוצרי המאגר אוסרים מפורשות על שימוש בו לאימון מודלים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗