GPT
Z

Zebra-CoT

קוד פתוח

multimodal-reasoning-labcc-by-nc-4.02025-05-25

  • visual-reasoning
  • multimodal
  • chain-of-thought

מאגר שמביא שרשראות חשיבה מרובות שלבים המשלבות טקסט ותמונות יחד. הוא מיועד למי שרוצה לאמן מודל שמייצר או מבין תרשימים ואיורים לאורך פתרון בעיה, ולא רק בסופה.

  • 4,720הורדות בחודש
  • 74לייקים

מה זה

המאגר כולל 182,384 רשומות המציגות שרשראות חשיבה שבהן שלבי ההסקה הטקסטואליים משולבים עם עזרי ראייה ואיורים. כל דוגמה בנויה מתיאור הבעיה בטקסט, תמונות מקדימות במידת הצורך, שרשרת צעדי חשיבה עם תגיות THOUGHT, תמונות עזר המלוות את פתרון הבעיה ותשובה סופית.

התוכן מחולק לארבע קטגוריות ראשיות. החלק הגדול ביותר מוקדש למשחקי היגיון ואסטרטגיה חזותיים עם 66,854 דוגמאות, המהוות 36.7 אחוז מהחומר. הסקת מסקנות חזותית בדו מימד תופסת 51,899 דוגמאות, הסקה בתלת מימד כוללת 39,610 דוגמאות, ותחום ההסקה המדעית כולל 24,021 דוגמאות. הכרטיס מציין ניקוי נתונים קפדני לווידוא התאמה של אחד לאחד בין המציינים בטקסט לתמונות בפועל.

מתאים ל

  • אימון מודלי חשיבה חזותית

    אימון מודלים מולטימודליים לייצור שרשרת הסקה המשלבת טקסט ותמונות שלב אחר שלב.

  • פיקוח על שלבי הסקה

    אימון מודלי תגמול או בקרת תהליך באמצעות חלוקת תגיות החשיבה לצעדים נפרדים.

  • מחקר על פתרון משחקים ומדע

    הערכת ביצועים של מערכות בינה מלאכותית בבעיות היגיון גיאומטריות ותלת מימדיות.

איפה זה נופל

הכרטיס לא מפרט את מקורות הנתונים הגולמיים, האם הם נוצרו באופן סינתטי או נלקחו ממשימות קיימות. השפה היא אנגלית בלבד, ואין כאן עברית כלל. בנוסף, המבנה דורש עבודת הכנה לא מעטה כדי להחליף את תגיות המיקום בתמונות האמיתיות, כך שהוא לא נטען ישר לתוך קוד אימון סטנדרטי בלי עיבוד מקדים. אם אתם מחפשים שאלות ראייה יומיומיות פשוטות, החומר כאן נוטה לכיוון תרשימים, משחקים ומדע, ולא ייצוג של העולם הפיזי הכללי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. המאגר מפורסם תחת רישיון cc-by-nc-4.0 שמגביל את השימוש למטרות שאינן מסחריות בלבד. כל מודל שתאמנו עליו יהיה מוגבל לאותם תנאים ולא יוכל להימכר כמוצר.

האם יש בדאטהסט נתונים בעברית?

לא, כל הטקסטים של השאלות, התשובות ושרשראות החשיבה הם באנגלית בלבד. אם המטרה שלכם היא מודל בעברית, תצטרכו לתרגם את הטקסטים בעצמכם תוך שמירה על תגיות התמונות.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

המאגר מאורגן ב־167 קבצי parquet הפרוסים על פני קטגוריות שונות לפי נושאים. הגישה חופשית ללא צורך בהרשאה מוקדמת, אך נדרש עיבוד מקדים להחלפת מצייני המיקום בתמונות עצמן.

מה היתרון של המאגר הזה על פני מאגרי שאלות ותשובות רגילים בתמונות?

במקום לתת שאלה ותשובה ישירה, המאגר מציג צעדי הסקה מפורטים הכוללים תמונות עזר ותרשימי ביניים. המבנה הזה מכוון ישירות לאימון מודלים שמסוגלים לחשוב ולהסביר את התהליך באופן חזותי.

איך טוענים

המאגר מחולק ל־167 קבצי parquet, למשל תחת תקיות כמו 2D Visual Reasoning. אין צורך באישור גישה מיוחד כדי להוריד אותו. בזמן העיבוד, שרשרת ההסקה כוללת תגיות מקום כמו image_start ו־image_end שצריך להחליף בתמונות האמיתיות. השדות המרכזיים שתרצו למפות הם תיאור השאלה, מערך תמונות ההסקה, ומקטעי המחשבה שממוספרים כ־THOUGHT_x, שמאפשרים לחלץ בקלות שלבים לאימון תהליכי או להמיר אותם לטוקנים ייעודיים של חשיבה.

from datasets import load_dataset

ds = load_dataset("multimodal-reasoning-lab/Zebra-CoT")

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: השימוש מותר למטרות מחקר ולימוד בלבד, ואסור לשימוש מסחרי מכל סוג. אתם חייבים לתת קרדיט ליוצרים המקוריים. אם תאמנו מודל על הנתונים האלה, לא תוכלו למכור שירותים המבוססים עליו או להטמיע אותו במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗