GPT
O

ODA-Mixture-100k

קוד פתוח

OpenDataArenaapache-2.02025-11-27

המאגר מרכז כ־100 אלף דוגמאות אימון מובחרות של מתמטיקה, קוד והסקה. המטרה היא להביא מודלי בסיס לתוצאות SFT תחרותיות בתקציב חישוב קטן יחסית.

  • 243הורדות בחודש
  • 99לייקים

מה זה

הנתונים מורכבים מכמעט מאה אחוז דוגמאות של שאלות ותשובות עם שלבי חשיבה מלאים, במבנה של בעיה, פירוט תהליך ההסקה ותשובה סופית. מבחינת הרכב, כמעט חצי מהחומר, 50,244 דוגמאות, מגיע ממאגר המתמטיקה AM-Thinking-Distilled-math. חצי נוסף, 50,245 דוגמאות, נלקח ממאגר הקוד AM-Thinking-Distilled-code. שאר הדאטהסט כולל 817 דוגמאות בלבד שנלקחו ממאגר LIMO כדי לתת עוגן ראשוני ליכולות הסקה כלליות.

הבנייה של המאגר התבססה על בחירת מאגרי מקור שהגיעו לראש הדירוג בפלטפורמת OpenDataArena. הצוות ביצע ניקוי כפילויות מלא על השאלות, והריץ סינון של דליפות מול מבחני ביצוע סטנדרטיים ומבחני תחרויות כדי למנוע זיהום של נתוני ההערכה. כדי לבחור כ־100 אלף דוגמאות מתוך מאגרי המקור הגדולים, הם חילקו את הנתונים לצבירים סמנטיים ודגמו מכל צביר את הדוגמאות הארוכות ביותר, מתוך הנחה שאורך הרצף מעיד על רמת קושי והסקה גבוהה.

מתאים ל

  • אימון SFT למודלי בסיס

    כוונון עדין יעיל של מודלי שפה פתוחים על משימות הסקה מורכבות בתקציב חישוב קטן.

  • שיפור ביצועי קוד

    חיזוק יכולות כתיבת קוד ופתרון אלגוריתמים בעזרת כ־50 אלף דוגמאות ייעודיות.

  • פתרון בעיות מתמטיות

    אימון מודלים על שרשראות חשיבה ארוכות לפתרון מדויק של שאלות מתמטיות קשות.

איפה זה נופל

המאגר מיועד באופן כמעט בלעדי למתמטיקה ולתכנות, ולכן חסרה בו לחלוטין תמיכה מפורשת בשפות נוספות כמו עברית, או בטקסטים ספרותיים ושיחות יומיומיות. שיטת הדגימה התבססה על אורך התשובה כמדד לקושי, מה שעלול לייצר הטיה למלל ארוך ומפותל שלא בהכרח נחוץ. בנוסף, מדובר בדאטה מזוקק ומסונן, כך שחשוב לבדוק את איכות ההסקה הידנית לפני שילוב שלו במערכות ייצור רגישות.

אותה משפחה

ODA-Mixture יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, המאגר פורסם תחת רישיון apache-2.0 שמתיר שימוש מסחרי מלא. אתם רשאים לאמן עליו מודלים פנימיים או מסחריים, ובלבד שתצרפו את תנאי הרישיון והודעת זכויות היוצרים של הפרויקט.

האם יש במאגר נתונים בעברית?

הכרטיס לא מציין תמיכה בעברית ומקורות הנתונים מתמקדים באנגלית, מתמטיקה וקוד. אם אתם מכוונים למודל שמדבר בעברית, המאגר הזה יכול לתרום לחשיבה הלוגית בלבד ותצטרכו להשלים נתונים בשפה המקומית.

איך נבחרו הדוגמאות מתוך מאגרי המקור?

החוקרים ביצעו חלוקה לצבירים סמנטיים של הנתונים ממאגרי LIMO ו־AM-Thinking. מתוך כל צביר הם בחרו את הדוגמאות בעלות רצף התווים הארוך ביותר, מתוך הנחה שזהו מדד ישיר לרמת מורכבות וחשיבה עמוקה.

במה המאגר שונה ממאגרים גדולים של מיליון דוגמאות?

הוא מתמקד ביעילות דאטה ולא בכמות גולמית. בדיקות שפורסמו על מודלי Qwen מראות שהדאטהסט הזה משיג ציונים קרובים, ולעיתים עדיפים, על פני מאגרים של מאות אלפי ומיליוני דוגמאות, תוך חיסכון ניכר בזמן אימון.

איך טוענים

המאגר זמין להורדה ישירה ללא צורך בהרשמה מוקדמת או אישור ידני. הנתונים מאורגנים בתיקיית data בתוך שמונה קובצי Parquet שונים, כך שניתן לטעון אותם בקלות בספריית datasets הרגילה. כל רשומה כוללת בסך הכל ארבעה שדות טקסט: מזהה ייחודי, שם מאגר המקור, שאלת המשתמש או ההוראה, והתשובה המלאה שכוללת את עקבות החשיבה.

from datasets import load_dataset

ds = load_dataset("OpenDataArena/ODA-Mixture-100k")

הרישיון

המאגר מופץ ברישיון apache-2.0. הרישיון מאפשר שימוש חופשי כולל שימוש מסחרי, שינוי של הנתונים והפצה מחודשת. אין חובת שיתוף תחת אותו הרישיון, כך שניתן לאמן עליו מודלים מסחריים סגורים, כל עוד שומרים על תנאי הייחוס והודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗