GPT
O

OpenThoughts-1k-sample

קוד פתוח

ryanmartenרישיון לא דווח2025-08-30

מדגם מצומצם של אלף דוגמאות מתוך מאגר חשיבה סינתטי רחב יותר. הוא מאפשר לבדוק את מבנה הנתונים ואיכות שרשראות ההסקה לפני שמורידים עשרות ג'יגה-בייט לאימון מלא.

  • 1,306,737הורדות בחודש
  • 51לייקים

מה זה

המאגר כולל אלף רשומות המכילות בעיות בתחומי מתמטיקה, מדעי הטבע, תכנות וחידות היגיון. לכל רשומה מוצמדים מסלול חשיבה מפורט ופתרון מלא, שניהם יוצרו באופן סינתטי באמצעות מודל DeepSeek-R1 ואומתו לבדיקת נכונות.

מקורות השאלות מגוונים ומבוססים על מאגרים קיימים כמו TACO, APPS ו־Codeforces בתחום הקוד, NuminaMath במתמטיקה, סדרת camel-ai לפיזיקה, כימיה וביולוגיה, ו־riddle_sense עבור חידות. הנתונים זמינים בשתי תצורות: תצורת ברירת המחדל שמיועדת לאימון ישיר, ותצורת מטא-דאטה הכוללת שדות מורחבים כמו פתרון האמת המקורי, מקור הדוגמה, ומקרי בדיקה עבור משימות תכנות.

מתאים ל

  • בדיקת מבנה הנתונים

    מאפשר לבחון את תאימות הפורמט לצינור האימון שלכם בלי להוריד את המאגר המלא.

  • הערכת איכות שרשראות חשיבה

    מספק דוגמה איכותית לבחינת עומק ההסקה והפתרונות של DeepSeek-R1 בתחומי מדע וקוד.

  • ולידציה של צינורות עיבוד

    מתאים להרצת בדיקות קוד מהירות על שדות המטא-דאטה ומקרי הבדיקה בתכנות.

איפה זה נופל

מדובר במדגם של אלף דוגמאות בלבד מתוך מאגר של 114 אלף, כך שהוא אינו מספיק כדי לאמן מודל חשיבה מאפס. בנוסף, כל מסלולי ההסקה מיוצרים באופן סינתטי על ידי DeepSeek-R1, מה שמחדיר למאגר את סגנון החשיבה וההטיות של מודל זה. המקורות כולם באנגלית, ואין בתיעוד שום מידע על התאמה לשפות אחרות או על טיפול בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא דווח רישיון עבור המאגר הזה בעמוד הרשמי. בהיעדר רישיון מוגדר, מבחינה משפטית אין אישור פתוח לעשות בו שימוש מסחרי. יש לפנות לצוות Open Thoughts כדי לקבל הבהרה לפני שמשלבים אותו במערכת מסחרית.

האם המאגר כולל תמיכה בעברית?

לא, הנתונים מבוססים על מאגרי מקור בינלאומיים בתחומי הקוד, המדע והמתמטיקה, וכולם באנגלית בלבד. פתרונות ההסקה יוצרו באנגלית, ואין במדגם שום ייצוג לטקסט בעברית.

כיצד נוצרו שרשראות החשיבה בדאטהסט?

החוקרים לקחו שאלות ממאגרים ידועים כמו TACO ו־NuminaMath, והריצו עליהן את המודל DeepSeek-R1 ליצירת שלבי ההסקה והפתרונות. לאחר מכן נערך תהליך אימות שווידא שהפתרון הסופי אכן נכון ביחס לפתרון המקורי.

מה ההבדל בין מאגר זה לגרסת ה־114k המלאה?

המאגר הנוכחי הוא תת-קבוצה קטנה של אלף דוגמאות שנלקחה מתוך המאגר השלם בן 114 אלף הדוגמאות. הוא נועד לספק תצוגה מקדימה מהירה של הנתונים, ולא לצורך אימון של מודלים שלמים כמו OpenThinker.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face בפקודת load_dataset עם הנתיב ryanmarten/OpenThoughts-1k-sample. הגישה חופשית ואינה דורשת אישור מיוחד. הנתונים שמורים בקובצי parquet בודדים עבור כל תצורה, ברירת המחדל או תצורת המטא-דאטה, כך שההורדה מהירה מאוד. אם רוצים לחקור את תהליך יצירת הנתונים עצמו, כדאי לטעון את תצורת המטא-דאטה שכוללת שדות כמו deepseek_reasoning, deepseek_solution, מקרי בדיקה וקוד התחלתי לתכנות.

from datasets import load_dataset

ds = load_dataset("ryanmarten/OpenThoughts-1k-sample")

הרישיון

המאגר מפורסם ללא הגדרת רישיון רשמית בכרטיס המידע. במצב כזה אין אישור מפורש לשימוש מסחרי, ואין הנחיות ברורות לגבי תנאי ייחוס או הפצה מחדש של מודלים שאומנו עליו. כל שימוש מעבר למחקר אישי או בדיקה ראשונית דורש בירור ישיר מול היוצרים כדי לא להסתכן בהפרת זכויות.

הרישיון המלא ב־Hugging Face ↗