GPT
C

ChartVerse-SFT-1.8M

קוד פתוח

opendatalabapache-2.02026-01-19

  • chart
  • reasoning
  • vision-language
  • multimodal
  • chart-understanding

המאגר מרכז 1.8 מיליון זוגות שאלות ותשובות מבוססות שרשראות חשיבה סביב תרשימים מורכבים. הוא מתאים למי שרוצה לאמן מודלי ראייה שפה על הסקת מסקנות מתרשימים בלי להסתמך על דאטה ידני.

  • 1,747הורדות בחודש
  • 139לייקים

מה זה

המאגר מבוסס על תהליך סינתטי שמתחיל ביצירת תרשימים מקוד פייתון. הוא מקיף מגוון סוגי ויזואליזציות, החל ממבנים היררכיים כמו עצי מפה ותרשימי שמש, דרך גרפים תלת ממדיים ועד לוחות מחוונים מרובי תרשימים ודיאגרמות סנקי. המורכבות של התרשימים נמדדת באמצעות מדד אנטרופיה ייעודי, שמסנן החוצה תרשימים פשוטים מדי ומבטיח שלפחות חלקם יציגו ויזואליזציות מורכבות.

השאלות והתשובות מיוצרות בגישה הפוכה. מודל שפה מנתח את קוד התרשים, מחשב תשובה דטרמיניסטית באמצעות הרצת פייתון, ורק אז גוזר את השאלה המתאימה. דוגמה נשמרת רק אם מודל נוסף מאמת שהתשובה תואמת לפלט הקוד. לאחר מכן, מודל מסוג Qwen3-VL מייצר שרשרת חשיבה מפורטת לכל שאלה. בסך הכל המאגר כולל כ־800 אלף תרשימים ייחודיים וכ־9 מיליארד טוקנים של הסקת מסקנות, עם אורך שרשרת ממוצע של כ־6,500 טוקנים.

בניגוד לגרסאות אחרות בפרויקט, כאן לא סיננו דוגמאות לפי שיעור כישלון של מודלים. הגרסה הזו כוללת את כל הדוגמאות שנמצאו נכונות בווידוא הקוד, כולל שאלות קלות וקשות יחד.

מתאים ל

  • אימון SFT למודלי ראייה

    לימוד מודלי ראייה שפה להפיק שרשראות חשיבה ארוכות ולהסיק מסקנות מתרשימים מורכבים.

  • הבנת גרפים ודיאגרמות

    שיפור ביצועים במענה על שאלות שמבוססות על תרשימי עמודות, סנקי ולוחות מחוונים.

  • זיקוק שרשראות חשיבה

    אימון מודלים קומפקטיים על כ־9 מיליארד טוקנים של הנמקה מובנית שנלקחו ממודל גדול.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על יצירה סינתטית מלאה. אין כאן תרשימים אותנטיים מתוך דוחות פיננסיים ישראליים, מאמרים בעברית או תמונות סרוקות באיכות נמוכה מהעולם האמיתי, אלא גרפיקה נקייה מקוד. כל שרשראות החשיבה זוקקו ממודל יחיד, Qwen3-VL-30B-A3B-Thinking, כך שהטיות הסגנון וטעויות הניתוח של המודל הזה עברו ישירות לתוך הטקסט. תצטרכו לבדוק בעצמכם את ההתאמה לתרשימים מטושטשים או לשפות אחרות לפני שתשלבו אותו במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

כן. הרישיון המדווח הוא Apache 2.0, שמתיר שימוש מסחרי חופשי, כולל אימון מודלים מסחריים. נדרש רק לתת קרדיט ליוצרים ולכלול את עותק הרישיון.

האם הדאטהסט מתאים לעבודה בעברית?

לא. המאגר מוגדר ומיוצר כולו באנגלית בלבד. התרשימים, השאלות ושרשראות ההנמקה נכתבו באנגלית, ואין בו תמיכה בשפה העברית.

מה ההבדל בין המאגר הזה לגרסת SFT-600K?

גרסת SFT-600K סיננה החוצה דוגמאות קלות שבהן מודלים לא נכשלו כלל. המאגר הזה כולל פי שלושה דוגמאות ומכיל את כל המקרים שנמצאו תקינים בקוד, בלי שום סינון לפי קושי.

מדוע מופיעות בו תמונות כפולות?

המפתחים יצרו מספר שאלות עבור אותה תמונת תרשים, ולחלק מהשאלות ייצרו כמה שרשראות חשיבה שונות. כתוצאה מכך, אותה תמונה משמשת מספר רשומות בדאטהסט.

איך טוענים

המאגר מחולק ל־129 קבצי Parquet שמכילים את כלל הרשומות, ואינו דורש אישור גישה מקדים או מילוי טפסים. אפשר לטעון אותו ישירות באמצעות ספריית datasets של Hugging Face.

שימו לב למבנה הדאטה לפני שאתם מתחילים חלוקה לאימון ובדיקה. מאחר שנוצרו מספר שאלות לכל תמונה ומספר שרשראות חשיבה לכל שאלה, תמונות רבות חוזרות על עצמן מספר פעמים. אם תחלקו את הרשומות באופן אקראי, תמונות זהות יזלגו בין קבוצת האימון לקבוצת הבדיקה.

from datasets import load_dataset

ds = load_dataset("opendatalab/ChartVerse-SFT-1.8M")

הרישיון

המאגר מופץ ברישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת הרישיון וציון הקרדיט למפתחים. אין דרישה לפתוח את הקוד שלכם או לשחרר מודל שאומן עליו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗