GPT
O

ODA-Mixture-500k

קוד פתוח

OpenDataArenaapache-2.02025-11-26

חצי מיליון דוגמאות אימון עם שרשראות חשיבה לשיפור מודלים במתמטיקה, קוד והיגיון. המאגר נבנה על בסיס נתונים מובילים מלוח תוצאות פתוח וסונן למניעת דליפת מבחנים.

  • 270הורדות בחודש
  • 123לייקים

מה זה

המאגר מכיל כחצי מיליון רשומות המיועדות לשלב ה־SFT, בפורמט של שאלה, תהליך חשיבה מפורט ותשובה סופית. הנתונים לא נאספו מאפס אלא הורכבו מחמישה מאגרי קוד פתוח שהציגו את הביצועים הטובים ביותר בלוח התוצאות של OpenDataArena. החלוקה הפנימית מציגה משקל כבד לקוד ולמתמטיקה: 150,252 דוגמאות מגיעות ממאגר הקוד AM-Thinking-Distilled-code ו־150,244 דוגמאות ממאגר המתמטיקה המקביל שלו, מה שמהווה יחד כמעט שישים אחוז מכלל החומר.

יתר הדאטהסט מורכב מ־104,913 רשומות היגיון שנלקחו מ־SYNTHETIC-2-SFT-verified, עוד 100,138 רשומות כלליות מ־math-gpt-4o-200k, ועוגן קטן של 817 דוגמאות שנבחרו ממאגר LIMO בשל יעילות הדגימה שלו. תהליך הסינון כלל הסרה מלאה של שאלות כפולות ובדיקת חפיפה קפדנית מול מבחני הערכה מקובלים כדי למנוע זליגת מידע. לאחר מכן הופעל אלגוריתם אשכול סמנטי כדי לדגום את הנתונים באופן אחיד בין הנושאים השונים.

מתאים ל

  • אימון SFT למודלי היגיון

    שיפור היכולת של מודלי שפה בפתרון בעיות מתמטיות מורכבות בעזרת שרשראות חשיבה מפורטות.

  • חיזוק יכולות כתיבת קוד

    אימון מודלים בסיסיים על מאגר של מעל 150 אלף דוגמאות קוד מזוקקות כדי להעלות דיוק בפתרון תקלות.

  • מחקר על יעילות נתונים

    בדיקת השפעת שילוב מאגרים ממקורות שונים על ציוני מודלים כמו Qwen בהשוואה למאגרי ענק.

איפה זה נופל

המאגר ממוקד כמעט לחלוטין במשימות מדעיות מדויקות של מתמטיקה, תכנות והיגיון פורמלי. אם המטרה שלכם היא מודל שיחה כללי, כתיבה חופשית או צ'אט בעברית, אין כאן מענה מתאים כי התוכן באנגלית ומכוון לפתרון בעיות טכניות. בנוסף, חלק גדול מהתשובות מבוסס על זיקוק ממודלים אחרים, מה שאומר שהטיות או שגיאות עדינות שהיו במודל המקור עלולות לחלחל פנימה. החוקרים אמנם ביצעו ניקוי מול מבחנים סטנדרטיים, אך יש לבדוק חפיפה מול בנצ'מרקים פרטיים לפני אימון.

אותה משפחה

ODA-Mixture יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים למוצרים פנימיים או פתוחים. חובה לשמור על תנאי הייחוס של הרישיון המקורי בקוד או בתיעוד. אין חובה לחשוף את משקלי המודל החדש שתאמנו.

האם הדאטהסט כולל תמיכה או שאלות בעברית?

לא, הנתונים מבוססים על קורפוסים באנגלית הממוקדים בקוד, במתמטיקה ובמבחני היגיון. שימוש במאגר הזה לבדו לא יעזור לשפר את השפה או ההבנה של מודל בעברית. לצורך עבודה מקומית תצטרכו לשלב מקורות ייעודיים לשפה.

באיזה אופן סוננו הנתונים כדי למנוע הטיה בהערכה?

היוצרים הסירו כפילויות מלאות של שאלות והפעילו סינון ייעודי למניעת דליפה מול מבחנים מוכרים כמו GSM8K, HumanEval ו־ARC-C. בנוסף בוצעה חלוקה לאשכולות סמנטיים ודגימה אחידה כדי לשמור על איזון נושאי.

מה מבדיל את המאגר ממאגרי אימון אחרים ברשת?

במקום לאסוף נתונים אקראיים, נבחרו תתי-מאגרים שהובילו בלוחות התוצאות של OpenDataArena בכל תחום ספציפי. התוצאה היא שילוב מרוכז של חצי מיליון דוגמאות שמציג ביצועים שווים או עדיפים על מאגרים בעלי מיליון דוגמאות ויותר.

איך טוענים

טוענים את המאגר ישירות בעזרת ספריית datasets של Hugging Face תוך שימוש במזהה המאגר. אין צורך בבקשת גישה או באישור ידני. כל הנתונים מפוצלים על פני 16 קבצי parquet בתיקיית המידע. המבנה של כל רשומה כולל ארבעה שדות בסיסיים: id כמזהה ייחודי, source שמציין מאיזה מאגר מקור השאלה הגיעה, question עם הטקסט של המשימה, ו־response שמחזיק את שרשרת ההיגיון והתשובה המלאה.

from datasets import load_dataset

ds = load_dataset("OpenDataArena/ODA-Mixture-500k")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים והפצה מחודשת, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. משקלי מודל שאומנו על המידע הזה אינם מחויבים להיפתח תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗