GPT
O

OpenThoughts2-1M

קוד פתוח

open-thoughtsapache-2.02025-04-03

  • synthetic
  • curator

מיליון דוגמאות סינתטיות של חשיבה ופתרון בעיות במתמטיקה, תכנות ומדעים. המאגר נבנה כדי לאמן מודלים להסביר שלב אחרי שלב ולהגיע לביצועים תחרותיים בלי להסתמך על נתונים סגורים.

  • 4,095הורדות בחודש
  • 155לייקים

מה זה

המאגר מכיל דוגמאות חשיבה סינתטיות שמיועדות לפתרון בעיות מורכבות. הוא מתבסס על שילוב של המאגר הקודם בסדרה, OpenThoughts-114k, יחד עם נתונים ממאגר OpenR1, ותוספות ייעודיות שנוצרו במיוחד עבור הפרויקט הזה בתחומי המתמטיקה וכתיבת הקוד.

במהלך הבנייה נבחנו מספר מאגרי חשיבה קיימים בקהילה, ובהם GeneralThought, Nemotron, Synthetic-1 ו־KodCode, באמצעות אימון של מודלי Qwen-2.5-7B-Instruct ובדיקתם על מבחני הערכה. מאגר OpenR1-Math נמצא כמוביל ולכן שולב בפנים.

לצד הנתונים הקיימים, פותחו שיטות חדשות ליצירת שאלות. נבדקו 11 שיטות בתחום המתמטיקה ו־15 שיטות בתחום הקוד, ומתוכן נבחרו המובילות לפי ביצועי המודלים במבחני ההערכה. המפתחים דגמו 30 אלף שאלות מכל אחד מחמשת המקורות הטובים ביותר לקוד, ו־12.5 אלף שאלות מכל אחד מארבעת המקורות המובילים למתמטיקה.

מתאים ל

  • אימון מודלי חשיבה

    אימון מודלים מותאמים אישית לפתרון בעיות שלב אחר שלב במתמטיקה ומדעים.

  • שיפור יכולות קוד

    כוונון עדין של מודלי שפה עבור ניתוח, כתיבה והסבר של אלגוריתמים.

  • בניית שרשראות הסבר

    שימוש ברשומות כבסיס להפקת דוגמאות שמסבירות תהליכי פתרון מורכבים.

איפה זה נופל

כל הדוגמאות במאגר הן נתונים סינתטיים וממוקדות בתחומי מדע, מתמטיקה, חידות ותכנות בלבד. אין כאן כיסוי לשיחה כללית, שפות שאינן אנגלית או עברית, ואין מידע לגבי התאמה למשימות טקסט סטנדרטיות. הכרטיס אינו מפרט את הצעדים שננקטו לסינון הזיות או שגיאות בשרשראות החשיבה הסינתטיות, ולכן חובה לבצע בדיקות איכות ובקרת שגיאות עצמאית לפני שמשלבים את המודלים שנוצרו בסביבת ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, המאגר מפורסם תחת רישיון apache-2.0 שמתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים ולהשתמש בתוצרים לכל צורך, ובלבד שתצרפו את תנאי הרישיון והודעת זכויות היוצרים המקורית.

האם יש במאגר שאלות או הסברים בעברית?

הדאטהסט ממוקד כולו באנגלית, מתמטיקה ושפות תכנות. הכרטיס לא מציין תמיכה בעברית או תרגום שלה. אם אתם צריכים יכולות חשיבה בעברית, תידרשו לתרגם את הדוגמאות או לבצע אימון המשך על נתונים מקומיים.

באיזה פורמט המידע מגיע ואיך מורידים אותו?

הנתונים מאוחסנים ב־39 קבצי Parquet שמכילים יחד כמיליון דוגמאות. אפשר לטעון אותם ישירות באמצעות ספריית datasets בלי צורך במפתחות גישה מיוחדים או אישור מצד המחברים.

איך נאספו ונוצרו הנתונים במאגר?

הבסיס נשען על המאגרים OpenThoughts-114k ו־OpenR1 שנבחרו לאחר ניסויי השוואה מול מאגרים אחרים. אליהם נוספו עשרות אלפי שאלות קוד ומתמטיקה שנוצרו בשיטות סינתטיות שנבחרו לפי ציוני המודלים במבחני ביצועים.

איך טוענים

הנתונים מחולקים ל־39 קבצי Parquet תחת תיקיית data, בפורמט שנע בין train-00000-of-00038 לבין train-00038-of-00038. אין צורך באישור גישה או ברישום מקדים, הקבצים פתוחים להורדה ישירה דרך Hugging Face. המאגר כולל גם קבצי הגדרה בפורמט yaml ששימשו לשילובי הנתונים השונים. מומלץ להוריד קובץ יחיד כדי לבדוק את מבנה הרשומות המדויק לפני שטוענים את כל מיליון הדוגמאות לתהליך האימון.

from datasets import load_dataset

ds = load_dataset("open-thoughts/OpenThoughts2-1M")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ואימון מודלים ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי. הרישיון אינו דורש שיתוף של מודלים מאומנים באותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗