GPT
M

MMFineReason-SFT-123K-Qwen3-VL-235B-Thinking

קוד פתוח

OpenDataArenaapache-2.02026-01-28

  • multimodal
  • reasoning
  • chain-of-thought
  • mathematics
  • science

מאגר ויזואלי של 123 אלף שאלות מורכבות עם שרשראות חשיבה מפורטות. הוא מרכז רק את הדוגמאות הקשות ביותר שבהן מודל ייעודי נכשל לחלוטין בארבעה ניסיונות שונים.

  • 713הורדות בחודש
  • 86לייקים

מה זה

המאגר מהווה תת קבוצה של שבעה אחוזים בלבד מתוך MMFineReason המקורי שכולל 1.8 מיליון דוגמאות. החוקרים השתמשו במודל Qwen3-VL-4B-Thinking כאינדיקטור לקושי, הריצו אותו ארבע פעמים על כל שאלה, וסיננו פנימה אך ורק מקרים שבהם שיעור ההצלחה שלו עמד על אפס עגול.

כל רשומה מגיעה ממאגרי מקור כמו Geometry3K, MMR1 ו־BMMR, ומכילה תמונה, שאלות ותשובות מקוריות לצד גרסאות נקיות באנגלית. בנוסף, ישנם תיאור תמונה מפורט שהופק על ידי מודל ענק, שרשרת חשיבה מעמיקה שהופקה על ידי Qwen3-VL-235B-A22B-Thinking, ובדיקות עקביות שמאמתות אם ההסקה תואמת לתשובת האמת.

מתאים ל

  • אימון SFT ממוקד חשיבה

    כוונון עדין של מודלי ראייה קטנים על מקרים קשים במיוחד הדורשים הסקה רב-שלבית.

  • זיקוק שרשראות חשיבה

    העברת יכולות הסקה ממודל 235B למודלים קומפקטיים באמצעות תגובות ה־CoT המוכנות.

  • בנצ'מרק למודלי ראייה

    בדיקת עמידות ויכולת פתרון בעיות קצה במודלים מתקדמים מול דגימות עם אחוזי מעבר אפסיים.

איפה זה נופל

המאגר כולו מבוסס על אנגלית בלבד ואין בו שום תוכן בעברית. שרשראות החשיבה ותיאורי התמונה נוצרו באופן סינתטי לחלוטין על ידי מודלים של שפת ראייה, מה שאומר שהטיות או כשלים לוגיים של המודל המייצר עלולים לזלג פנימה למרות בדיקות העקביות. בנוסף, מאחר שסוננו רק דוגמאות קיצון שנכשלו על ידי מודל קטן, אימון בלעדי עליו עשוי לפגוע בביצועים על שאלות פשוטות ויומיומיות.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

כן, הרישיון הוא apache-2.0 ולכן מותר לאמן עליו מודלים מסחריים או לשלב אותו במערכות פנימיות. צריך רק להקפיד על מתן קרדיט ושמירת קובץ הרישיון המקורי.

האם יש כאן תמיכה בעברית?

לא. הטקסטים, השאלות ושרשראות החשיבה מוגדרים כולם באנגלית בלבד. אם המטרה היא מודל רב לשוני, תצטרכו לתרגם את הנתונים או להוסיף מקורות אחרים.

איך אספו וסיננו את הנתונים האלה?

החוקרים לקחו 1.8 מיליון דוגמאות ממאגרים שונים ובדקו אותן מול המודל Qwen3-VL-4B-Thinking בארבעה ניסיונות שונים. המאגר הזה שומר אך ורק את 123 אלף הדוגמאות שבהן המודל כשל בכולן ולא הצליח אפילו פעם אחת.

מה ההבדל בינו לבין הגרסה המלאה של 1.8 מיליון רשומות?

הגרסה המלאה כוללת המון שאלות קלות שמוסיפות רעש לאימון. כאן מדובר בתמצית של 7% הקשים ביותר, שמספקת לפי החוקרים אותם ביצועים באימון עם חיסכון ניכר בזמן ובמשאבי חישוב.

איך טוענים

הנתונים מפוצלים ל־18 קובצי parquet תחת תיקיית data, ללא צורך בבקשת גישה מיוחדת. בעבודה מולו תשתמשו בעיקר בשדות התמונה, השאלה הנקייה ושרשרת החשיבה הארוכה. כדאי לשים לב ששדה התמונה מחזיק אובייקט ויזואלי מלא, כך שזמני ההורדה והטעינה לזיכרון דורשים הכנה מראש לתעבורת רשת ונפח אחסון משמעותיים.

from datasets import load_dataset

ds = load_dataset("OpenDataArena/MMFineReason-SFT-123K-Qwen3-VL-235B-Thinking")

הרישיון

הפרויקט משוחרר ברישיון apache-2.0 המאפשר שימוש מסחרי, שינוי והפצה של הנתונים, כולל אימון מודלים לכל מטרה. נדרש לשמור על הודעת זכויות היוצרים והרישיון המקורי, אך אין חובה לשתף את המודלים המאומנים או נגזרותיהם תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗