GPT
G

gpt-5.4-step-by-step-reasoning

קוד פתוח

Roman1111111mit2026-03-24

מאגר סינתטי של 1,500 דוגמאות מורכבות במתמטיקה, תכנות ורפואה, שנבנו במיוחד לאימון מודלים על שרשראות חשיבה ארוכות. הוא נועד למי שמחפש קפיצת היגיון ממוקדת במקום מיליוני רשומות שיחה רגילות.

  • 109הורדות בחודש
  • 65לייקים

מה זה

המאגר כולל בדיוק 1,500 דוגמאות סינתטיות שנבחרו לפי דרישה של לפחות 15 צעדי היגיון לפתרון. הנתונים לא נאספו מהרשת אלא נוצרו בתהליך דו שלבי, שבו Gemini 3 Flash ניסח שאלות מורכבות במטרה שלא יהיה אפשר למצוא להן מענה ישיר במנוע חיפוש, ומודל GPT-5.4 ייצר את צעדי ההיסק המלאים ואת הפתרון הסופי.

התוכן מחולק לשלושה תחומים מרכזיים ברמת קושי שמוגדרת בכרטיס כרמת פוסט דוקטורט. במתמטיקה יש הוכחות בטופולוגיה ואלגברה לא ליניארית, בתכנות מושם דגש על מערכות מבוזרות, אופטימיזציה באסמבלי ובדיקות בטיחות זיכרון ברוסט, וברפואה מופיעים אבחונים מבדלים של תחלואות נלוות נדירות וניתוח גנומי.

מתאים ל

  • כוונון עדין למודלי היגיון

    אימון מודלים קיימים ליצירת תהליכי מחשבה ארוכים ומפורטים לפני מתן התשובה הסופית.

  • פתרון בעיות קוד מורכבות

    לימוד מודל לנתח מיפוי זיכרון ולבצע אופטימיזציות באסמבלי ובמערכות מבוזרות.

  • הסקה רפואית מרובת שלבים

    אימון על שיטות שלילת אבחנות ברפואה מורכבת על בסיס רצף צעדים מובנה.

איפה זה נופל

הנתונים כולם באנגלית טכנית, מדעית ורפואית בלבד, ללא שום ייצוג לעברית. היוצר מציין במפורש שמבנה עקבות החשיבה אינו אחיד, וייתכן שתצטרכו לעטוף אותם ידנית בתגיות ייעודיות לפני שתזינו אותם לאימון. כמו כן, מודלים קטנים מ־3 מיליארד פרמטרים עלולים להתקשות בקליטת ההיגיון המורכב, והחומר הרפואי והתכנותי נוצר כולו באופן סינתטי תחת מגבלות בטיחות, כך שלא הייתי משתמש בזה למערכות ייצור רפואיות בלי בדיקה אנושית מחמירה של מומחה תוכן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן השימוש המסחרי מותר. עליכם לכלול את תנאי הרישיון המקוריים ואת הצהרת זכויות היוצרים של היוצר. אין דרישה לפתוח את הקוד של מודל שאומן על המאגר.

האם הדאטהסט כולל טקסטים בעברית?

לא. כל 1,500 הדוגמאות נוצרו באנגלית טכנית, מדעית ורפואית בלבד. מי שבונה מודל לעברית יצטרך לתרגם את הנתונים או להשתמש בהם רק לבניית יכולות הסקה גנריות.

איך נאספו הנתונים וכמה טוקנים יש בפנים?

הנתונים הם סינתטיים לחלוטין ולא נגרדו מאתרים. מודל Gemini 3 Flash ניסח שאלות ברמת קושי גבוהה, ו־GPT-5.4 יצר את הפתרונות המלאים בהיקף כולל של כ־3.3 מיליון טוקנים.

במה המאגר הזה שונה ממאגרי שיחה רגילים?

הוא מתמקד בשרשראות היגיון צפופות שדורשות לפחות 15 שלבים אנליטיים לפתרון, בלי תוכן שיחה רגיל. חלק ההיגיון בכל דוגמה ארוך לעיתים פי עשרה מהתשובה הסופית עצמה.

איך טוענים

הקובץ המרכזי שמכיל את המידע הוא gpt5.4.jsonl, לצד קובץ התיעוד README.md, כך שאין צורך במשקלים כבדים או בהורדה ממושכת. המאגר פתוח לחלוטין ואינו דורש אישור גישה מיוחד. בעת הטעינה, השדות העיקריים לעבודה הם prompt עבור השאלה, step_by_step_trace שמכיל את כל מהלך החשיבה הפנימי, ו־final_solution שמחזיק את התוצאה הסופית. יש גם שדות סיווג לרמת הקושי ולתחום הדעת.

from datasets import load_dataset

ds = load_dataset("Roman1111111/gpt-5.4-step-by-step-reasoning")

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ומחייב רק שמירה על הודעת זכויות היוצרים המקורית. הוא אינו כופה עליכם לשחרר מודלים שאומנו עליו תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗