GPT
M

MMFineReason-Full-2.3M-Qwen3-VL-235B-Thinking

קוד פתוח

OpenDataArenaapache-2.02025-10-24

  • multimodal
  • reasoning
  • chain-of-thought
  • mathematics
  • science

מאגר ענק של 2.3 מיליון דוגמאות חשיבה ויזואלית שנוצרו על ידי מודל ענק. הוא כולל בכוונה גם טעויות, מה שהופך אותו לכלי מחקר ייעודי לסינון נתונים ובדיקת איכות.

  • 5,492הורדות בחודש
  • 65לייקים

מה זה

המאגר מכיל 2,286,130 רשומות המבוססות על שאלות ותמונות ממקורות שונים כמו ScienceQA, Geometry3K, Raven ו־VisualSphinx. עבור כל תמונה ושאלה, המודל Qwen3-VL-235B-A22B ייצר תיאור ויזואלי מפורט ותהליך חשיבה ארוך לפני מתן התשובה הסופית. בסך הכל נכללים כאן כמעט 8.8 מיליארד טוקנים של פתרונות.

הייחוד כאן הוא שמדובר בגרסה שלפני שלב הסינון האיכותי הסופי. המפתחים ניקו 84,484 דוגמאות בגלל תקלות תבנית או תגיות פגומות ועוד 1,806 בגלל חריגות אורך, אך השאירו את כל השאר. רק כ־79 אחוז מהדוגמאות הגיעו לתשובה שתואמת את האמת בשטח, והיתר כוללות שגיאות חישוב או הסקה.

מתאים ל

  • מחקר שיטות סינון נתונים

    פיתוח אלגוריתמים לזיהוי שגיאות בחשיבה של מודלים מול עובדות, בזכות שדה הבדיקה is_consistent המובנה.

  • אימון מודלים להערכת איכות

    בניית מודלי שופט שלומדים להבדיל בין שרשרת חשיבה נכונה לכזו שמובילה לתשובה שגויה על בסיס תמונה.

  • ניתוח קשיי הסקה ויזואלית

    בדיקת התנהגות מודלי ענק מול סוגי בעיות שונים תוך שימוש במדד הקושי המובנה qwen3vl_4b_pass_rate.

איפה זה נופל

היוצרים עצמם ממליצים לא לאמן מודלים ישירות על המאגר הזה ללא סינון נוסף, אלא להשתמש בגרסת ה־1.8M הנקייה שלהם. כ־21 אחוז מהדוגמאות מכילות פתרונות שגויים, ובמשימות מופשטות כמו VisualSphinx או Raven שיעור ההתאמה צונח ל־36 עד 39 אחוז בלבד. בנוסף, כל הנתונים והשאלות קיימים באנגלית בלבד ואין בו שום תמיכה בעברית.

שאלות
נפוצות

האם המאגר מתאים לאימון ישיר של מודל ראייה?

לא מומלץ לאמן עליו ישירות. כ־20 אחוז מהדגימות מכילות תשובות לא נכונות שהמודל ייצר. אם המטרה היא אימון נטו, עדיף לקחת את MMFineReason-1.8M שבו המפתחים כבר סיננו את הטעויות.

האם יש במאגר שאלות או תמונות בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל הטקסטים, השאלות ותהליכי החשיבה נוצרו באנגלית.

האם מותר להשתמש בו למוצרים מסחריים?

המאגר מפורסם ברישיון Apache 2.0 המתיר שימוש מסחרי. יחד עם זאת, הנתונים מורכבים מדאטהסטים שונים ממקורות חיצוניים, ולכן חובה לוודא שרישיונות המקור של אותם מאגרים אינם מגבילים אתכם.

מה מייצג השדה is_consistent בכל שורה?

השדה מציין בערך בוליאני האם התשובה שהמודל חילץ מתוך תגיות ה־answer תואמת לחלוטין את התשובה הנכונה במקור. זה מאפשר לכם לסנן נתונים שגויים בעצמכם בקלות רבה.

איך טוענים

הנתונים מחולקים ל־235 קבצי Parquet לפי מקורות, למשל תיקיית BMMR שמחולקת ל־36 חלקים. המאגר פתוח להורדה ישירה דרך Hugging Face ללא צורך באישור גישה מראש. השדות המרכזיים כוללים את התמונה, שאלת המקור, תהליך החשיבה המלא בשדה qwen3vl_235b_thinking_response, שדה בוליאני בשם is_consistent שמסמן האם התשובה נכונה, ומדד קושי בשם qwen3vl_4b_pass_rate שנע בין 0 ל־1.

from datasets import load_dataset

ds = load_dataset("OpenDataArena/MMFineReason-Full-2.3M-Qwen3-VL-235B-Thinking")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה, בכפוף למתן קרדיט וצירוף עותק הרישיון המקורי. הרישיון חל על המאגר עצמו, אך יש לוודא שהשימוש בדאטהסטים המקוריים שמהם נלקחו השאלות והתמונות אינו סותר את תנאי המקור שלהם לפני אימון מודל מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗