GPT
O

OpenThoughts3-1.2M

קוד פתוח

open-thoughtsapache-2.02025-05-28

  • reasoning
  • mathematics
  • code
  • science

מאגר חשיבה והסקה בקוד פתוח עם 1.2 מיליון דוגמאות שנבנו סביב בעיות עמוקות. הוא מיועד למי שרוצה לאמן מודל לחשיבה שלב אחר שלב במתמטיקה, תכנות ומדעים.

  • 19,541הורדות בחודש
  • 257לייקים

מה זה

המאגר כולל 1.2 מיליון שורות, אבל חשוב להבין את המבנה הפנימי שלו. המקור מורכב למעשה מ־75,000 שאלות ייחודיות בלבד. כל שאלה קיבלה 16 דגימות פתרון שונות שנוצרו באמצעות המודל QwQ-32B, וכך הגיעו לנפח הסופי. החלוקה הנושאית כוללת 850,000 שאלות במתמטיקה, 250,000 בתכנות ו־100,000 שאלות בתחומי המדעים.

איסוף השאלות שילב טקסטים אנושיים כמו StackExchange Physics לצד מקורות סינתטיים כמו openmath-2-math. הצוות סינן תחילה את המאגר הגולמי ל־180 אלף שאלות מתמטיקה, 60 אלף קוד ו־60 אלף מדעים, ביצע ניקוי כפילויות, ואז דילל את הנתונים ל־75 אלף השאלות הנבחרות לפני שלב הפקת התשובות.

מתאים ל

  • אימון מודלי חשיבה

    כוונון עדין של מודלי שפה להפקת שרשראות חשיבה ארוכות בפתרון בעיות.

  • הערכת פתרון בעיות קוד

    בדיקת יכולות פירוק אלגוריתמים והבנת קוד על בסיס 250 אלף דוגמאות.

  • מחקר על דגימות פתרון

    ניתוח 16 מסלולי פתרון שונים לכל שאלה לחקר שיטות סינון ובחירת תשובה.

איפה זה נופל

זהו דאטהסט סינתטי כמעט לחלוטין ברמת הפתרונות. כל התשובות הופקו על ידי QwQ-32B, מה שאומר שהטיות, שגיאות היגיון נסתרות וסגנון החשיבה של המודל הזה מוטמעים עמוק בתוך הדאטה. מגוון הבעיות מוגבל ל־75,000 בלבד, כך שיש כאן חזרתיות גבוהה של אותן בעיות בווריאציות פתרון שונות. בנוסף, כל החומר באנגלית ומתמקד בנושאים טכניים ופורמליים, ללא שום נתונים בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן. הדאטהסט מוגדר תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, כולל אימון מודלים פנימיים או מסחריים, כל עוד מצרפים את תנאי הרישיון המקורי.

האם יש בדאטהסט שאלות בעברית?

לא. המאגר מבוסס על שאלות ממקורות בינלאומיים כמו סטאק אקסצ'יינג' ודאטהסטים מתמטיים קיימים, והפתרונות נוצרו באנגלית בלבד.

מאיפה הגיעו התשובות וההסברים?

התשובות ושרשראות החשיבה לא נכתבו בידי אדם. הצוות לקח 75 אלף שאלות מסוננות והריץ עליהן את המודל QwQ-32B, שייצר 16 פתרונות מנומקים לכל שאלה.

באיזה פורמט המידע שמור וכמה קבצים יש?

הנתונים מאוחסנים בפורמט parquet ומפוצלים ל־121 קבצים שונים. הפיצול מאפשר לטעון ולעבד חלקים בנפרד במקום להוריד קובץ ענק אחד.

איך טוענים

הדאטהסט פתוח להורדה ישירה ללא צורך באישור גישה. הנתונים מחולקים ל־121 קבצי parquet נפרדים בתיקיית data. בגלל כמות הקבצים וההיקף של 1.2 מיליון רשומות, מומלץ לעבוד איתו בהזרמה או לוודא מראש שיש מספיק זיכרון עבודה ונפח אחסון מקומי לפני שמושכים את כל החלקים ברצף.

from datasets import load_dataset

ds = load_dataset("open-thoughts/OpenThoughts3-1.2M")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה מחודשת, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. מותר לאמן עליו מודלים מסחריים בלי חובה לחשוף את משקולות המודל שאימנתם או לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗