GPT
C

ChartNet

קוד פתוח

ibm-granitecdla-permissive-2.02026-03-17

מאגר ענק להבנת תרשימים שמצמיד תמונות לקוד מקור, טבלאות נתונים ותהליכי חשיבה מפורטים. הוא מאפשר לאמן מודלים על חילוץ ערכים מדויק במקום ניחושים ויזואליים.

  • 13,513הורדות בחודש
  • 44לייקים

מה זה

המאגר מכיל מעל 4 מיליון דוגמאות סינתטיות של תרשימים מ־24 סוגים שונים שנוצרו באמצעות שש ספריות קוד, לצד סט חיצוני של 30 אלף תרשימים מהעולם האמיתי. כל רשומה כוללת חמישה מרכיבים מסונכרנים: קוד המקור שיצר את הגרף, התמונה המרונדרת, טבלת הנתונים הגולמית, סיכום טקסטואלי, ושאלות ותשובות עם שרשרת חשיבה מלאה שלב אחר שלב.

הבנייה התבססה על סינתזה מונחית קוד שהחלה מגרעין תמונות קטן, שוחזרה לקוד על ידי מודל ראייה, ומשם הורחבה למגוון סגנונות ונתונים שעברו סינון איכות. החלוקה הפנימית כוללת תת-מאגר ליבה מתירני של 2.5 מיליון שורות, תת-מאגר מקורי של 1.7 מיליון רשומות, חלק ייעודי לשאלות עם מיקום גיאומטרי של תיבות תוחמות, וסט של כ־94 אלף דוגמאות שווידאו בני אדם, מתוכן 2,000 דוגמאות שמורות לבדיקה והערכה.

מתאים ל

  • חילוץ טבלאות מגרפים

    אימון מודל שמקבל תמונת גרף ומייצר בחזרה את קובץ הטבלה שממנו הוא נבנה.

  • מענה מנומק על תרשימים

    בניית מודלי שפה ויזואליים שמסבירים מגמות בגרף צעד אחר צעד על בסיס שרשרת החשיבה.

  • שחזור קוד שרטוט

    יצירת כלי שהופך תמונה של תרשים לקוד פייתון פעיל שמשחזר את המראה שלו.

איפה זה נופל

הרוב המוחלט של התרשימים סינתטי לחלוטין ומיוצר על ידי קוד, כך שהם לא בהכרח מייצגים את הלכלוך, הסריקות העקומות והעיצובים המשונים שרואים בדוחות אמיתיים בישראל. הנתונים מגיעים באנגלית בלבד ואין פה ייצוג לעברית, לטבלאות מימין לשמאל או לפונטים מקומיים. בנוסף, חלקי המאגר המקוריים נוצרו תוך שימוש במודלים תחת רישיון מחקרי של מיסטרל ולכן הם מוגבלים לבדיקת תוצאות המאמר בלבד, מה שמחייב ערנות בבחירת תת-המאגר הנכון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, אבל רק אם אתם מושכים את החלק שנקרא core permissive, ששוחרר תחת רישיון פתוח. שאר חלקי המאגר המקוריים אסורים לשימוש מסחרי לחלוטין מכיוון שנוצרו על בסיס רישיון מחקר של מיסטרל.

כמה שוקל כל המאגר והאם אפשר להוריד אותו למחשב אישי?

המאגר כולו שוקל מאות ג'יגה-בייט ומחולק למאות קובצי פארקט. קובץ בודד שמכיל עשרת אלפים שורות שוקל 1.66 ג'יגה, ולכן מומלץ לעבוד עם טעינה חלקית או להוריד קבצים מסוימים לפי צורך במקום את כולם.

האם יש במאגר תרשימים בעברית?

לא. התרשימים, הטבלאות, הסיכומים והשאלות נוצרו כולם באנגלית. אם אתם צריכים מודל שמבין גרפים עם טקסט עברי או תמיכה בכיווניות מימין לשמאל, תצטרכו להוסיף דאטה ייעודי משלכם.

איך אספו ויצרו את הנתונים?

התהליך התחיל מאוסף גרעין קטן של תמונות שהומרו לקוד שרטוט בעזרת מודל ראייה. הקוד שימש ליצירת מיליוני תרשימים סינתטיים חדשים עם ספריות גרפיקה שונות, ומתוכו חילצו באופן אוטומטי את הטבלאות, התקצירים והשאלות.

איך טוענים

טוענים את המאגר דרך ספריית הנתונים הרגילה של האגינג פייס בפייתון ישירות לפי שם החלק המבוקש. הנפח עצום ומגיע למאות ג'יגה-בייט בסך הכל על פני 620 קבצים, לכן עדיף להוריד קבצי פארקט בודדים לפי צורך ולא למשוך הכל בבת אחת. קובץ פארקט בודד מחזיק כעשרת אלפים שורות ושוקל כ־1.66 ג'יגה. אין צורך בבקשת גישה מיוחדת, והחיבור בין חלקים שונים מתבצע לפי שדה המזהה הייחודי.

from datasets import load_dataset

ds = load_dataset("ibm-granite/ChartNet")

הרישיון

החלק שנקרא core permissive זמין תחת רישיון cdla-permissive-2.0, שמתיר שימוש מסחרי, שינוי ואימון מודלים חופשי בלי לכפות פתיחה של הקוד שלכם, בכפוף לייחוס בלבד. לעומת זאת, החלקים המקוריים כבולים לתנאי מחקר קפדניים שאוסרים כל שימוש מסחרי בגלל תנאי הרישיון של המודלים שיצרו אותם.

הרישיון המלא ב־Hugging Face ↗