GPT
C

CuratedThoughts

קוד פתוח

bethgelabרישיון לא דווח2025-02-16

גרסאות מסוננות של מאגרי חשיבה מתמטית פופולריים שנועדו לאימון מודלים בלמידת חיזוק. החוקרים ניקו שאלות עם סעיפים פתוחים, הוכחות ללא בדיקה אוטומטית ותרשימים חסרים שמחרבים אימוני חיזוק.

  • 2,705הורדות בחודש
  • 44לייקים

מה זה

המאגר כולל גרסאות נקיות לשלושה מאגרי בסיס מוכרים, ביניהם OpenR1-Math-220k, OpenThoughts-114k וגרסת המתמטיקה שלו. הרשומות מבוססות על שאלות חשיבה ופתרונות, אך עברו סינון אגרסיבי של דוגמאות שפוגעות באימון מסוג GRPO. בשיטה הזו המודל זקוק לתשובה יחידה שניתן לאמת באופן חד משמעי, ואילו המאגרים המקוריים היו עמוסים ברעש שהכשיל את מנגנון התגמול.

צוות המחקר זיהה ארבע בעיות מרכזיות שפסלו אלפי דוגמאות. הבעיה הראשונה היא שאלות שכוללות תתי סעיפים כשרק אחד מהם פתור בעמודת התשובה, מה שמכשיל את שאר הסעיפים. הבעיה השנייה והמשמעותית ביותר היא בקשות להוכחה מתמטית, שם אין למערכת דרך אוטומטית לאמת נכונות. בנוסף הוסרו שאלות שמפנות לאיורים שלא קיימים בטקסט, ושאלות שבהן הפתרון המוגדר פשוט ריק. ב־OpenThoughts-114k לבדו נפסלו כמעט ארבעים ואחד אחוזים מהנתונים.

מתאים ל

  • אימון GRPO מתמטי

    אימון מודלים על בעיות עם תוצאה חד משמעית שמאפשרת מתן תגמול אוטומטי ואמין.

  • כוונון עדין לשאלות חישוב

    אימון מונחה על שרשראות חשיבה שנפטרו משאלות עם סעיפים פתוחים או הוכחות.

  • הערכת ביצועי הסקה

    בדיקת מודלים מול בסיס שאלות נקי מתרשימים חסרים וערכים ריקים בעמודת הפתרון.

איפה זה נופל

הסינון נשען כולו על תבניות regex קשיחות באנגלית שמחפשות מילים כמו הוכחה או הפניות לאיורים. שיטה כזו עלולה לייצר מחיקות שגויות של שאלות לגיטימיות, ובמקביל לפספס שאלות שבורות שלא נפלו בדיוק על התבנית. בנוסף, כל הנתונים באנגלית ומוכוונים ספציפית למתמטיקה ולוגיקה, כך שאין כאן שום מענה לטקסט כללי או שפות אחרות. אם תנסו לאמן על זה פתרון שאלות מרובות שלבים או שאלות פתוחות, המאגר הזה פשוט לא מתאים כי הוא נועד רק לתשובות קצרות ומוחלטות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

לא מומלץ כרגע. היוצרים לא הגדירו שום רישיון במאגר, ובמצב כזה כל הזכויות שמורות ואין הרשאה מפורשת לשימוש מסחרי או להפצה.

במה הוא שונה מ־OpenR1 המקורי?

המאגר הזה מסנן שאלות פגומות שהיו במקור. הוא מסיר שאלות הדורשות הוכחות שאי אפשר לבדוק בקוד, שאלות עם איורים שנעלמו ושאלות עם סעיפים מרובים.

האם יש במאגר שאלות בעברית?

לא. הנתונים מבוססים על מאגרי מקור באנגלית, וכל כלי הסינון שפיתחו החוקרים נשענים על ביטויים ותבניות בשפה האנגלית בלבד.

כמה אחוזים מהנתונים נזרקו בסינון?

תלוי במאגר המקור. ב־Open-R1 נזרקו קצת יותר מחמישה אחוזים, אבל ב־OpenThoughts-114k נמחקו קרוב לארבעים ואחד אחוזים מהדוגמאות עקב בעיות חמורות.

איך טוענים

טוענים את המאגר ישירות מתוך Hugging Face בעזרת ספריית datasets הרגילה, תוך ציון המזהה bethgelab/CuratedThoughts ללא צורך באישור גישה מיוחד. הנתונים מחולקים לעשרים ושניים קובצי parquet, כאשר חלקי הקבצים מופרדים לפי מאגרי המקור כמו תיקיית ברירת המחדל של OpenR1-Math-220k שמחולקת לעשרה חלקים שונים. בעת הטעינה כדאי לבחור מראש את החלוקה הרצויה כדי להימנע ממשיכה של כל הנפח בבת אחת. השדות המרכזיים שמעניינים אתכם הם נוסח השאלה ועמודת הפתרון, שבה נותרו רק ערכים סופיים הניתנים לבדיקה ממוחשבת.

from datasets import load_dataset

ds = load_dataset("bethgelab/CuratedThoughts")

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המאגר. מבחינה משפטית, היעדר רישיון מוגדר משאיר את הזכויות שמורות ויוצר סיכון ממשי לכל שימוש מסחרי או שילוב במוצר קיים. כל עוד לא עודכן רישיון מתאים, המאגר מיועד למחקר אקדמי ולבדיקות בלבד, ואי אפשר לדעת בוודאות מה מותר לעשות עם משקולות של מודל שאומן עליו.

הרישיון המלא ב־Hugging Face ↗