GPT
C

ChartGalaxy

קוד פתוח

ChartGalaxycc-by-nc-4.02025-05-07

  • infographic
  • chart

המאגר כולל קרוב לשני מיליון אינפוגרפיקות ותרשימים לצד טבלאות הנתונים המקוריות שלהם. הוא נבנה במיוחד כדי ללמד מודלים חזותיים לחלץ מידע מגרפים מורכבים ולייצר עבורם קוד.

  • 115,733הורדות בחודש
  • 89לייקים

מה זה

המאגר מכיל 1,880,687 רשומות שמחולקות לשני חלקים ברורים. החלק האמיתי כולל 61,978 אינפוגרפיקות שנאספו מ־18 אתרים מוכרים ברשת, ביניהם Statista ו־Visual Capitalist. החלק הסינתטי, שמהווה את הרוב המוחלט עם 1,818,709 תמונות, נבנה באופן תוכנתי מתוך תבניות שנלמדו מהחומר האמיתי.

המפתחים הגדירו 75 סוגי תרשימים עם 440 וריאציות עיצוביות, ופרסו אותם על פני 68 תבניות פריסה שונות לצד דפים במבנה חופשי. כל רשומה כוללת את תמונת התרשים, מזהה, סוג הגרף והווריאציה שלו, מקור המידע, ומחרוזת JSON שמכילה את הטבלה הגולמית שממנה נוצר הגרף. התצוגה המקדימה באתר מציגה רק דגימה של 2,000 פריטים מהחלק הסינתטי.

מתאים ל

  • חילוץ טבלאות מאינפוגרפיקה

    אימון מודלים להמרת תמונות גרפים מורכבות בחזרה לטבלאות נתונים מדויקות.

  • יצירת קוד תרשימים

    פיתוח מערכות שמקבלות תמונה של גרף ומייצרות ממנה קוד D3.js מקביל.

  • מענה חזותי על שאלות

    שיפור יכולת המודל להבין פריסות מורכבות של טקסט ומספרים בתוך אינפוגרפיקות.

איפה זה נופל

הנתונים כולם באנגלית, בלי שום ייצוג לעברית או לשפות שנכתבות מימין לשמאל, מה שיקשה על מודל לקרוא אינפוגרפיקות מקומיות. הרוב המוחלט של המאגר הוא סינתטי ומבוסס על שילובים של 68 תבניות קבועות, כך שקיים סיכון להטיה ואי התאמה מול גרפים מהעולם האמיתי שלא בנויים לפי הכללים האלה. בנוסף, הכרטיס לא מציין סינון של תוכן או בדיקת שגיאות בטבלאות שחולצו מהרשת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כרגע זה מסוכן מאוד. בהגדרות המאגר מסומן רישיון cc-by-nc-4.0 שאוסר שימוש מסחרי, למרות שבטקסט עצמו נכתב Apache 2.0. עד שהיוצרים לא יתקנו את הסתירה הזו באופן רשמי, עדיף להניח שהשימוש מוגבל למחקר בלבד.

האם יש במאגר אינפוגרפיקות או נתונים בעברית?

לא, המאגר מוגדר כדובר אנגלית בלבד. כל התרשימים האמיתיים הגיעו מאתרים בינלאומיים והחלק הסינתטי יוצר באותה שפה. אם אתם צריכים תמיכה בגרפים בעברית או בכיווניות מימין לשמאל, תצטרכו לאסוף או לייצר דאטה בנפרד.

מאיפה הגיעו הנתונים של התרשימים האמיתיים?

החלק הלא סינתטי כולל 61,978 תרשימים שנאספו מ־18 אתרים שמפרסמים אינפוגרפיקות, כמו Statista ו־Visual Capitalist. התמונות האלו צומדו לטבלאות המקוריות שלהן כדי לשמש קרקע להשוואה מול הדור הסינתטי. שאר המאגר, מעל 1.8 מיליון פריטים, נוצר כולו במחשב לפי חוקיות עיצובית קבועה.

איך טוענים

המידע המלא שמור ב־397 קבצים, רובם ארכיוני tar מחולקים שמכילים את התמונות והנתונים, לצד קובץ eval_data.zip ונתוני JSON נפרדים לחלק האמיתי. אין צורך בבקשת גישה מיוחדת, והטעינה נעשית דרך סקריפט ייעודי בשם dataset.py. השדות המרכזיים לעבודה הם שדה התמונה ושדה הנתונים שמכיל את הטבלה. בגלל שמדובר במאות קבצים מכווצים שמכילים קרוב לשני מיליון תמונות, תצטרכו להכין נפח אחסון משמעותי ותהליך חילוץ מסודר לפני שתוכלו לאמן.

from datasets import load_dataset

ds = load_dataset("ChartGalaxy/ChartGalaxy")

הרישיון

יש כאן סתירה שחובה לשים אליה לב. המטא-דאטה של הדף מסמן את הרישיון בתור cc-by-nc-4.0, שאוסר במפורש שימוש מסחרי ומחייב מתן קרדיט. מנגד, גוף הטקסט טוען שהפרויקט משוחרר תחת Apache 2.0 המתירני. כל עוד הפער הזה לא מובהר מול היוצרים, אי אפשר להשתמש במאגר או במודל שאומן עליו לצרכים מסחריים בלי להסתכן.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗