GPT
S

SYNTHETIC-1

קוד פתוח

PrimeIntellectapache-2.02025-02-20

שני מיליון מסלולי חשיבה שנוצרו על ידי Deepseek-R1 במטרה לאמן מודלים על פתרון בעיות מורכבות. המאגר כולל תיוגים של מאמתים שונים למתמטיקה, קוד ושאלות מדעיות.

  • 1,725הורדות בחודש
  • 64לייקים

מה זה

המאגר כולל עקבות חשיבה גולמיים בתחומי מתמטיקה, תכנות ומדעים מדויקים. החלוקה הפנימית מורכבת מ־777 אלף בעיות מתמטיקה תחרותיות שמקורן ב־NuminaMath, 144 אלף אתגרי קוד אלגוריתמיים מאתרים כמו Leetcode ו־Codeforces, ו־70 אלף בעיות הנדסת תוכנה שנגזרו משינויי קוד אמיתיים ב־GitHub מתוך CommitPack. בנוסף נכללו 313 אלף שאלות מדעיות מ־StackExchange ו־61 אלף משימות סינתטיות להבנת קוד ומניפולציית מחרוזות.

איסוף הנתונים התבסס על כוח מחשוב מבוזר שיצר את הפלטים דרך Deepseek-R1, לצד שימוש במודלי שפה כדי לעבד שאלות אמריקאיות לשאלות פתוחות או לתרגם קוד לפייתון, ג'אווהסקריפט, C++ ו־Rust. כל רשומה כוללת הערכה של מאמת ייעודי, החל מאימות סימבולי במתמטיקה, הרצת בדיקות יחידה בתוך קונטיינרים לקוד, ועד שופטי LLM והשוואת מחרוזות מדויקת.

מתאים ל

  • אימון מודלי חשיבה

    אימון מודלי שפה על תהליכי פתרון שלב אחר שלב במתמטיקה וקוד, לאחר סינון הפלטים השגויים.

  • בניית מאמתי תוכנה ומדע

    מחקר ואימון מערכות שיפוט מבוססות LLM לאימות תשובות הנדסיות ומדעיות מורכבות.

  • שיפור ביצועי קוד ואלגוריתמים

    כוונון עדין של מודלים לפתרון בעיות תכנות תחרותיות בארבע שפות פיתוח שונות.

איפה זה נופל

זו הגרסה הגולמית של המאגר, והיוצרים מציינים במפורש שהיא לא עברה סינון לנכונות הפתרונות. אם תזינו אותה ישירות למודל ללא סינון לפי תוצאות המאמתים, תאמנו אותו גם על טעויות וחישובים שגויים. בנוסף, כל המקורות והמשימות מבוססים על אנגלית וקוד, כך שאין כאן שום מידע בעברית או ייצוג מקומי. חלק גדול מהבדיקות להנדסת תוכנה ושאלות מדעיות נשען על שיפוט של מודלי שפה אחרים, מה שמכניס הטיות וטעויות שיפוט סובייקטיביות.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן, המאגר פורסם תחת רישיון apache-2.0 שמתיר שימוש מסחרי מלא. מותר לאמן עליו מודלים פנימיים או מוצרים מסחריים, כל עוד שומרים על תנאי הייחוס של הרישיון.

האם המאגר כולל עברית?

לא. התוכן כולו נשען על קוד, תחרויות מתמטיקה ומאגרים באנגלית כמו StackExchange ו־GitHub. אין בדאטהסט נתונים בשפה העברית.

האם הפתרונות במאגר נכונים ומאומתים?

לא כולם. זו גרסה גולמית שלא סוננה לפי נכונות, ולכן קיימות בה שגיאות חשיבה של Deepseek-R1. הרשומות כוללות ציונים ובדיקות של מאמתים, אך הסינון בפועל נשאר בידיים שלכם.

איך נוצרו הנתונים במאגר?

המשימות נאספו ממאגרים ציבוריים כמו NuminaMath, CommitPack ו־StackExchange, ועובדו על ידי מודלים. מסלולי החשיבה הופקו מ־Deepseek-R1 באמצעות מחשוב מבוזר והוערכו על ידי כלי אימות שונים.

איך טוענים

הנתונים מפוצלים ל־112 קובצי parquet ממוספרים תחת תיקיית data, ללא צורך בבקשת גישה מיוחדת או אישור מקדים. אפשר לטעון אותם ישירות באמצעות ספריית datasets של Hugging Face. שדות המידע מכילים את משימות המקור, מסלול החשיבה המלא של המודל, ואת הערכות המאמתים השונים שהוטמעו דרך ספריית genesys.

from datasets import load_dataset

ds = load_dataset("PrimeIntellect/SYNTHETIC-1")

הרישיון

המאגר שוחרר ברישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר מודלים שאימנתם תחת אותו רישיון. החובה העיקרית היא מתן קרדיט וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗