GPT
M

MMFineReason-1.8M-Qwen3-VL-235B-Thinking

קוד פתוח

OpenDataArenaapache-2.02026-01-28

  • multimodal
  • reasoning
  • chain-of-thought
  • mathematics
  • science

1.8 מיליון דוגמאות מולטימודליות עם שרשראות חשיבה ארוכות שזוקקו ממודל ענק. המאגר מתאים למי שרוצה לאמן מודל ראייה ושפה על פתרון בעיות מורכבות של שלב אחר שלב.

  • 1,845הורדות בחודש
  • 126לייקים

מה זה

המאגר מכיל 1.8 מיליון רשומות המיועדות לאימון מודלים מולטימודליים על פתרון בעיות. הנתונים נאספו ממאגרי קוד פתוח מוכרים כמו MMR1, BMMR ו־Geometry3K, ועברו תרגום של שאלות לאנגלית, שכתוב של הוראות קצרות, וניקוי תמונות פגומות. כל רשומה כוללת תמונה, שאלה מנוסחת באנגלית, תיאור תמונה מפורט ותשובה מלאה עם שרשרת חשיבה שחולצה מהמודל Qwen3-VL-235B-A22B-Thinking, כשהיא מחולקת לתגיות חשיבה ותשובה סופית.

מבחינת תחומי ידע, מתמטיקה תופסת 79.4 אחוזים מכלל הנתונים, מדעים מהווים 13.8 אחוזים, חידות ומשחקים עומדים על 4.6 אחוזים, ועוד 2.2 אחוזים מוקדשים למשימות זיהוי טקסט כללי. החוקרים ניפו כעשרים אחוזים מהפלט שלא עמד בבדיקות אימות, וחילקו את הקבצים במאגר לשלבי אימון שונים של כוונון מונחה וחיזוק.

מתאים ל

  • אימון מודלי ראייה לחשיבה

    כוונון מודלי תמונה וטקסט להפקת נימוקים ארוכים שלב אחר שלב לפני מתן תשובה סופית.

  • פתרון בעיות במתמטיקה ומדע

    אימון מודלים להבנת גרפים, נוסחאות ותרשימים גיאומטריים מסובכים הדורשים הסבר לוגי.

  • סינון דוגמאות לפי קושי

    בניית תוכניות לימוד למודלים קטנים באמצעות שימוש בשדה אחוז המעבר כאינדיקטור לאתגר.

איפה זה נופל

98.3 אחוזים מהתמונות הם שרטוטים הנדסיים, נוסחאות ודיאגרמות, כשרק 1.7 אחוזים מציגים תמונות מהעולם האמיתי כמו רחובות או בני אדם. כל הטקסט באנגלית בלבד, ואין כאן נתונים בעברית. שרשראות החשיבה מגיעות ממודל סינתטי של 235 מיליארד פרמטרים, ולכן תיתכן שגיאה לוגית מנומקת שנראית אמינה אך אינה נכונה במציאות.

שאלות
נפוצות

האם המאגר מתאים למוצרים הפועלים בעברית?

לא. כל השאלות וההסברים כתובים באנגלית בלבד, לאחר שעברו תרגום ועיבוד. כדי לעבוד בעברית תצטרכו לתרגם את הנתונים בעצמכם או לאמן מודל שיודע לגשר בין השפות.

האם מותר להשתמש בדאטהסט הזה לצרכים מסחריים?

המאגר עצמו מופץ ברישיון Apache 2.0 המתיר שימוש מסחרי חופשי. למרות זאת, החומרים המקוריים נאספו ממאגרים שונים שלכל אחד מהם עשויים להיות תנאים משלו, ולכן נדרשת בדיקה של מקורות הנתונים עצמם.

איך המאגר הזה שונה ממאגרי מולטימודל רגילים?

הוא מתמקד בשרשראות חשיבה ארוכות במיוחד עם ממוצע של 2,910 טוקנים לתשובה. בנוסף, כל תמונה מלווה בתיאור ויזואלי צפוף של מאות טוקנים שנוצר על ידי מודל שפה גדול.

איך נאספו ונוצרו התשובות וההסברים?

החוקרים לקחו נתונים ממאגרים פתוחים, ניקו אותם, והזינו אותם למודל Qwen3-VL-235B-A22B-Thinking. לאחר מכן נפסלו כעשרים אחוזים מהפלט שלא תאמו את התשובה הנכונה או נכשלו בבדיקות איכות.

איך טוענים

הנתונים מחולקים ל־198 קבצי Parquet תחת תיקיית data, שמתוכם 193 קבצים מיועדים לכוונון עדין מונחה וחמישה לאימון בחיזוק. המאגר פתוח להורדה ישירה דרך Hugging Face ללא צורך באישור מוקדם. השדות המרכזיים לעבודה הם התמונה, השאלה באנגלית, שדה התשובה עם שרשרת החשיבה, ומדד אחוז המעבר של מודל הביקורת שבאמצעותו אפשר לסנן דוגמאות לפי רמת קושי.

from datasets import load_dataset

ds = load_dataset("OpenDataArena/MMFineReason-1.8M-Qwen3-VL-235B-Thinking")

הרישיון

המאגר מפורסם תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה ללא דרישה לפתוח את הקוד הנגזר. עם זאת, יוצרי המאגר מציינים כי הנתונים נאספו ממקורות חיצוניים מרובים, ולכן מומלץ לבדוק את תנאי הרישיון של המאגרים המקוריים לפני שילוב במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗