GPT
O

OpenThoughts-114k-math

קוד פתוח

open-r1רישיון לא דווח2025-01-29

המאגר מרכז שאלות מתמטיקה עם שרשראות חשיבה ארוכות של דיפסיק אר אחת, בתוספת בדיקת נכונות אוטומטית. הוא מיועד למי שרוצה לאמן מודלים על פתרון בעיות בלי להסתמך על הזיות.

  • 3,533הורדות בחודש
  • 98לייקים

מה זה

הצוות של אופן אר אחת לקח את המאגר המקורי של אופן תוטס, שכלל פלטים גולמיים של דיפסיק אר אחת בלי תיוג, וסינן מתוכו רק את תוכן המתמטיקה. הם זיהו את השאלות המקוריות מתוך מאגר נומינה מאת סי או טי, הצליבו אותן מול הפלטים, והוסיפו את פתרון הזהב המקורי לכל שאלה. מתוך שמונים ותשעה אלף ומאה ועשרים רשומות מתמטיות, הם השתמשו בספריית מאת וריפיי כדי לבדוק את התוצאות, ומצאו שרק שישים ושלושה אחוזים מהתשובות, חמישים ושישה אלף ושבע מאות ושלושים פלטים, נכונות בפועל.

המבנה של כל רשומה כולל את השאלה המקורית, פתרון המקור, פרומפט המערכת שנשלח למודל, והשיחה המלאה שמכילה את שרשרת החשיבה והפלט הסופי. בנוסף ישנם שדות שסופרים את הטוקנים של הפלט לפי הטוקנייזר של דיפסיק אר אחת, ותגית בוליאנית שמציינת אם הפלט תואם לפתרון המקור.

מתאים ל

  • אימון מודלים להסקה

    אימון עדין של מודלי שפה על שרשראות חשיבה ארוכות של מתמטיקה, תוך סינון הרשומות שהוגדרו כנכונות בלבד.

  • הערכת בדיקת תשובות

    בחינת יכולות הסינון של ספריות אוטומטיות על ידי השוואה בין שרשרת ההסקה של המודל לפתרון המקור.

  • ניתוח אורכי הנמקה

    מחקר על הקשר בין אורך הפלט בטוקנים לבין דיוק התשובה הסופית במשימות חשיבה מורכבות.

איפה זה נופל

הבעיה המרכזית היא ששלושים ושבעה אחוזים מהפלטים במאגר המקורי שגויים, ולכן אי אפשר לזרוק אותו לאימון כמו שהוא אלא חייבים לפלטר לפי שדה הבדיקה. הבדיקה עצמה התבצעה באמצעות כלי אוטומטי, כך שייתכנו מקרים שבהם פתרון נכון נפסל או פתרון שגוי אושר בגלל כשל בהשוואת ביטויים. אין כאן מגוון פתרונות אלא יצירה בודדת לכל שאלה, והטקסט באנגלית בלבד ללא שום התאמה לעברית או לניסוחים מקומיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ כרגע, כי לא דווח רישיון למאגר. שימוש מסחרי במידע ללא רישיון מפורש משאיר אתכם חשופים משפטית, במיוחד כשהתוכן מבוסס על פלטים של דיפסיק ומאגרים אחרים.

האם יש במאגר שאלות בעברית?

אין במאגר עברית בכלל. השאלות נלקחו ממאגר נומינה מאת, והפלטים נוצרו באנגלית בלבד על ידי המודל.

במה הוא שונה מהמאגר המקורי של אופן תוטס?

המאגר המקורי כלל רק שני שדות גולמיים בלי פתרונות זהב. כאן בודדו שאלות המתמטיקה, הצליבו אותן עם פתרון המקור, והוסיפו סימון האם הפלט של המודל נכון או שגוי.

איך המאגר מאוחסן ואיך הוא בנוי?

הוא מחולק לחמישה קבצי פרקט בגודל כולל של כמה ג׳יגהבייט להורדה. הגישה אליו חופשית לגמרי דרך השרתים של הגינג פייס ללא צורך באישור ידני.

איך טוענים

טוענים את המאגר דרך ספריית דאטהסטס מיוזר אופן אר אחת. הנתונים מחולקים לחמישה קבצי פרקט תחת תיקיית המידע, ללא צורך בהרשאה מיוחדת או אישור גישה מראש. לפני שמתחילים לאמן, השדה החשוב ביותר לסינון הוא שדה הנכונות, אחרת תאכילו את המודל בהנמקות שגויות. בנוסף כדאי לשים לב לשדה ספירת הטוקנים, שכן אורך הפלט הממוצע עומד על ששת אלפים ושלוש מאות שישים ושבעה טוקנים עם סטיית תקן של ארבעת אלפים ושש מאות שישים ושלושה טוקנים, מה שדורש חלון הקשר משמעותי.

from datasets import load_dataset

ds = load_dataset("open-r1/OpenThoughts-114k-math")

הרישיון

המאגר פורסם ללא רישיון מוגדר, וכרגע לא מופיע רישיון בכרטיס המידע. במצב כזה, מבחינה משפטית אין היתר שימוש ברור, מה שיוצר סיכון משמעותי לשימוש מסחרי או לשילוב במוצר חי. כל עוד היוצרים לא הגדירו רישיון פתוח, כל אימון של מודל עליו עלול לחשוף אתכם לדרישות זכויות יוצרים של יוצרי המאגר או של הדאטהסטים שממנו הוא הורכב.

הרישיון המלא ב־Hugging Face ↗