GPT
O

OpenThoughts-114k

קוד פתוח

open-thoughtsapache-2.02025-01-27

  • curator
  • synthetic

מאגר סינתטי של 114,000 דוגמאות חשיבה במתמטיקה, קוד, מדעים וחידות. הוא נועד למי שרוצה לאמן מודלי שפה על תהליכי הסקת מסקנות מלאים שחולצו מתוך דיפסיק.

  • 105,628הורדות בחודש
  • 907לייקים

מה זה

המאגר מכיל דוגמאות שנבנו על בסיס בעיות מכמה מקורות קיימים. בתחום הקוד נלקחו שאלות ממאגרי טאקו, אפס, קוד קונטסטס ופתרונות קודפורסס. בתחום המתמטיקה נעשה שימוש בנומינה מת', המדעים מתבססים על מאגרי פיזיקה, כימיה וביולוגיה של קאמל, ותחום החידות מגיע מרידל סנס.

על בסיס השאלות האלו הופקו עקבות חשיבה באמצעות המודל דיפסיק אר אחת, תוך אימות של נכונות הפתרונות. המאגר מציע שתי תצורות: תצורת ברירת המחדל שנועדה לאימון ישיר, ותצורת מטא דאטה שכוללת את השאלה המקורית, פתרון האמת, תהליך ההסקה של דיפסיק, התחום, המקור, ומקרי בדיקה או קוד התחלתי עבור בעיות תכנות.

מתאים ל

  • אימון מודלי הסקה

    כוונון עדין של מודלי שפה פתוחים על תהליכי פתרון מפורטים במתמטיקה, מדעי הטבע ותכנות.

  • מחקרי זיקוק ידע

    ניתוח והערכה של ביצועי מודלים קטנים שאומנו על פלטים סינתטיים של מודלי ענק.

  • בניית מאגרי הערכה

    שימוש בתצורת המטא דאטה כדי לבחון מודלים מול בעיות ומקרי בדיקה קיימים.

איפה זה נופל

הנתונים כולם סינתטיים ונוצרו על ידי דיפסיק אר אחת, מה שאומר שההטיות, הסגנון וטעויות החשיבה הסמויות של המודל הזה מובנים בתוך הדאטה. המאגר ממוקד כולו באנגלית ובשפות תכנות, ואין בו שום ייצוג לעברית. בנוסף, האימות מסתמך על מבחנים קיימים ופתרונות אמת מהמקורות המקוריים, כך שאם יש טעות במקור או בבדיקה, היא תעבור ישירות אל המודל שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח הוא אפאצ'י שתיים אפס שמתיר שימוש מסחרי חופשי בכפוף למתן ייחוס. עם זאת, מכיוון שהנתונים הופקו באמצעות דיפסיק אר אחת, כדאי לוודא שתנאי השימוש של שירות המקור אינם מגבילים את אופי השימוש שלכם.

האם המאגר כולל תוכן בעברית?

לא. כל הבעיות, החידות ותהליכי ההסקה נוצרו באנגלית ובשפות תכנות על בסיס מאגרים בינלאומיים. אם המטרה היא אימון יכולות חשיבה בעברית, תידרשו לתרגם את החומר או לייצר דאטהסט ייעודי.

איך נאספו ונוצרו הנתונים בפועל?

החוקרים לקחו שאלות ממאגרים ידועים במתמטיקה, קוד, מדעים וחידות, והריצו עליהן את דיפסיק אר אחת כדי לקבל עקבות חשיבה מלאים. לאחר מכן הם סיננו ובדקו את נכונות התוצאות מול פתרונות אמת ומקרי בדיקה של הקוד.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה של האגינג פייס באמצעות הפקודה load_dataset ללא צורך באישור גישה מיוחד. הנתונים שמורים בקובצי פרקט שמחולקים לשישה חלקים ברכבת האימון. אפשר לטעון את תצורת ברירת המחדל כדי לקבל דאטה מוכן לאימון, או לציין את תצורת המטא דאטה כדי לגשת לשדות כמו הבעיה, מקרי הבדיקה, תהליך ההסקה והפתרון המאומת.

from datasets import load_dataset

ds = load_dataset("open-thoughts/OpenThoughts-114k")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולהפיץ נגזרות שלו, כל עוד שומרים על הודעת הרישיון ומתן הקרדיט הנדרש. הרישיון חל על הדאטהסט עצמו, אך אימון מודל עליו דורש לוודא שאין התנגשות עם תנאי השימוש של המודל שייצר את הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗