GPT
G

GeneralThoughtArchive

קוד פתוח

RJT1990mit2025-03-14

430 אלף שאלות עם מסלולי חשיבה ותשובות של מודלי ריזונינג מובילים. המאגר נותן בסיס רחב לזיקוק מודלים ולחקר תהליכי מחשבה שאינם מוגבלים למתמטיקה.

  • 2,963הורדות בחודש
  • 79לייקים

מה זה

המאגר מרכז 430 אלף רשומות שכוללות שאלות, תשובות ייחוס, עקבות חשיבה ותשובות סופיות שנוצרו על ידי שורה של מודלים פתוחים וסגורים. בין המודלים שתהליך החשיבה שלהם מתועד נמצאים DeepSeek-R1, גרסת ה־Zero שלו, OpenThoughts-32B, LIMO, דגמים מזוקקים של Llama ו־DeepScaleR. בנוסף, יש תשובות סופיות של מודלים קנייניים כמו o3-mini, gemini-2-flash-thinking ו־claude-3-7-sonnet שנועדו להשוואה והערכה.

בניגוד לאוספים מוקדמים שהתמקדו בקוד ומתמטיקה, הדגש כאן הוא על גיוון נושאי. השאלות נלקחו ממאגרים כמו Numina, SCP-116k ו־natural_reasoning, ומכסות מדעי הטבע, מדעי הרוח, מדעי החברה ושיחות כלליות. כל רשומה מציינת את מקור השאלה המקורי ומאפשרת מעקב אחרי שרשרת ההסקה המלאה.

מתאים ל

  • זיקוק מודלי הסקה קטנים

    אימון מודלים קלים על מסלולי חשיבה מפורטים כדי לשפר את יכולת פתרון הבעיות שלהם.

  • השוואת סגנונות חשיבה

    ניתוח הבדלים בין מודלים באורך ההסקה, שימוש במילות קישור ומעבר בין שפות מחשבה.

  • בניית מאגר להערכה

    בדיקת ביצועים מול תשובות של מודלים מובילים בתחומי מדעי הרוח והחברה.

איפה זה נופל

היוצרים הודיעו שהפרויקט כבר לא מתוחזק ונשמר רק כארכיון ממרץ 2025, כך שאין לצפות לתיקוני שגיאות או עדכונים. כל המידע באנגלית בלבד ואין בו שום תוכן בעברית. בנוסף, עקבות החשיבה הן פלט של מודלים אחרים, מה שאומר שהן עשויות להכיל הזיות מובנות, הנחות שגויות או סגנון הסקה שלא תמיד מתאים ישירות למשימות ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון המאגר הוא MIT, שמתיר שימוש מסחרי מלא. עם זאת, הנתונים כוללים פלטים של מודלים מסחריים כמו o3-mini וקלאוד, שתנאי השימוש שלהם אוסרים לעיתים אימון מודלים מתחרים. כדאי לבדוק את הסיכון המשפטי הזה לפני שמתחילים.

האם המאגר כולל עברית?

לא. המאגר מוגדר ומכיל טקסט באנגלית בלבד. אם המטרה היא לאמן או להעריך מודל להסקה בעברית, הנתונים כאן לא יעזרו בלי תרגום מלא.

מה ההבדל בינו לבין מאגרים כמו NuminaMath?

מאגרים כמו NuminaMath מתמקדים כמעט לחלוטין במתמטיקה טהורה. המאגר הזה לוקח שאלות ממקורות שונים ומרחיב את עקבות החשיבה לתחומי מדעי הטבע, החברה ושיחות כלליות, לצד פלטים מכמה מודלים שונים במקביל.

האם הפרויקט ממשיך לקבל עדכונים?

לא. היוצרים הבהירו בעמוד הדאטהסט שמדובר בפרויקט צדדי שהסתיים ונשמר כארכיון בלבד החל ממרץ 2025. לא יתווספו דוגמאות חדשות ולא יתוקנו נתונים קיימים.

איך טוענים

הנתונים מפוצלים לקבצי parquet ממוספרים, לפחות 15 חלקים שונים, ללא דרישת הרשאה מיוחדת או אישור גישה מראש. אפשר לטעון אותם ישירות דרך הספרייה של Hugging Face. השדות המרכזיים שצריך לשים לב אליהם הם תוכן השאלה, עקבות החשיבה, התשובה הסופית, ומקור השאלה שמזהה מאיזה מאגר בסיס היא הגיעה.

from datasets import load_dataset

ds = load_dataset("RJT1990/GeneralThoughtArchive")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בכפוף לשמירת הודעת זכויות היוצרים. עם זאת, אימון מודל על פלטים של מודלים סגורים כמו אלה של OpenAI או Anthropic עלול להתנגש עם תנאי השימוש של אותן חברות, ללא קשר לרישיון של המאגר עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗