GPT
O

OpenO1-SFT-Ultra

קוד פתוח

O1-OPENרישיון לא דווח2024-12-17

המאגר כולל מיליוני דוגמאות אימון עם שרשראות חשיבה מפורטות במתמטיקה, קוד והיגיון. הוא מיועד למי שרוצה ללמד מודל פתוח להסביר את תהליך הפתרון שלו לעומק.

  • 191הורדות בחודש
  • 56לייקים

מה זה

הנתונים מבוססים על איסוף ממאגרי קוד פתוח כמו WebInstructFull, MathInstruct, math-stack-exchange, infinity-instruct, שיעורי בית ומאגרי שאלות אמריקאיות. על בסיס השאלות האלו, המודל openo1-qwen-sft ייצר תגובות ארוכות שכוללות תהליך מחשבה מפורט לצד התשובה הסופית.

כדי לסנן את התוכן, הצוות השתמש במודל qwen-2.5-72b-instruct שדירג כל דוגמה לפי רמת קושי ואיכות בסולם של 1 עד 10, וסיווג את סוגי השאלות. המאגר מכיל רק דוגמאות שקיבלו ציון 8 ומעלה בשני המדדים האלה. הרשומות מחולקות לתחומי מתמטיקה, תכנות והיגיון, עם תיוג ייעודי למבנה התשובה וטסטים לחלק מדוגמאות הקוד.

מתאים ל

  • אימון מודלים לחשיבה

    לימוד מודלי שפה לייצר שרשראות חשיבה ארוכות ומנומקות לפני שהם מחזירים תשובה סופית.

  • סינון דאטה למתמטיקה וקוד

    שליפת דוגמאות מורכבות בלבד בעזרת תיוגי האיכות, הקושי וטסטים מוכנים המצורפים לשאלות התכנות.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של נתוני אימון שנוצרו וסוננו במלואם על ידי מודלים אחרים ללא פיקוח אנושי.

איפה זה נופל

כל תהליכי החשיבה והדירוגים נוצרו על ידי מודלים סינתטיים ולא אומתו בידי אדם. הכרטיס לא מציין תמיכה בעברית, והמקורות שנאספו הם באנגלית. בנוסף, חלוקת הקושי והאיכות נשענת לגמרי על השיפוט של מודל יחיד, כך שהטיות או שגיאות עובדתיות בתהליך ההסקה עלולות לזלוג ישירות למודל שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא כדאי לגעת בזה למוצר מסחרי. בעלי המאגר לא פרסמו רישיון כלל, מה שאומר שאין הרשאת שימוש רשמית. בנוסף, הנתונים נלקחו ממקורות רשת שונים שלא ברור מה הרישוי המקורי שלהם.

האם יש כאן נתונים בעברית?

אין במאגר עברית. כל מקורות המידע שנאספו הם באנגלית, וגם תהליכי החשיבה נוצרו באנגלית בלבד. אם אתם מכוונים למודל בעברית, תצטרכו לתרגם את החומר או לפנות למקורות אחרים.

איך נוצר המאגר?

היוצרים אספו שאלות ממאגרים פתוחים שונים כמו MathInstruct ו־math-stack-exchange. מודל openo1-qwen-sft ייצר עבורן תהליכי חשיבה ארוכים, ומודל qwen-2.5-72b-instruct דירג וסינן רק את התוכן שקיבל ציון איכות וקושי של 8 ומעלה.

כמה שוקל הדאטה ואיך הוא בנוי?

המאגר מפוצל ל־13 קבצים, כאשר חלקם מאורגנים בתיקיית Round-1 המכילה שמונה קובצי parquet שונים. הכרטיס מדווח על 35 מיליון דוגמאות, כך שמדובר בנפח תעבורה ואחסון משמעותי מאוד שדורש משאבים מתאימים לפריקה וטעינה.

איך טוענים

החומר מחולק לקובצי parquet מרובים, למשל תחת התיקייה OpenO1-SFT-Ultra-Round-1 שכוללת שמונה קבצים שונים. אין צורך באישור גישה מיוחד כדי להוריד אותם ישירות דרך ספריית datasets. ברשומות תמצאו שדות כמו query לשאלה המקורית, response לתהליך החשיבה והתשובה, answer לתשובה הסופית המקורית, ודירוגי difficulty ו־quality לצד סיווגי הנושא.

from datasets import load_dataset

ds = load_dataset("O1-OPEN/OpenO1-SFT-Ultra")

הרישיון

היוצרים לא הגדירו רישיון במאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש במידע, לא למחקר ולא לשימוש מסחרי. מי שבוחר לאמן מודל על הנתונים האלה לוקח על עצמו סיכון של הפרת זכויות יוצרים.

הרישיון המלא ב־Hugging Face ↗