GPT
J

jupyter-agent-dataset

קוד פתוח

jupyter-agentapache-2.02025-09-02

  • jupyter
  • kaggle
  • agents
  • code
  • synthetic

מאגר של 51,389 מחברות סינתטיות עם שאלות ותשובות מבוססות נתונים. הוא נבנה כדי לאמן סוכני קוד להריץ פייתון, לחקור דאטהסטים ולחשב פתרונות בשלבים.

  • 968הורדות בחודש
  • 172לייקים

מה זה

הנתונים מבוססים על מחברות קוד ציבוריות מ־Meta Kaggle שעברו סינון והורדה של קובצי המקור המקושרים אליהן. הצוות השתמש בספריית Datatrove לניקוי כפילויות, דירג את האיכות הלימודית של הקוד באמצעות מודל Qwen-32B, וסינן החוצה מחברות שלא עסקו בניתוח נתונים או שלא טענו קבצים בפועל.

מתוך המחברות הנקיות נוצרו זוגות שאלה ותשובה מאומתים, וכן עקבות הרצה מלאים שנכתבו בידי מודל Qwen-Coder-480B. ההרצות בוצעו בסביבת E2B אמיתית כשדאטהסט המקור היה זמין, או סומלצו בסביבת מודל כשלא היה זמין. המאגר מציע שתי חלוקות, thinking ו־non-thinking, בהתאם לצורך בתגיות מחשבה של מודל הבסיס, וכולל סך הכל כ־200 מיליון תוקנים לאימון.

מתאים ל

  • אימון סוכני קוד מבוססי כלים

    אימון מודלים בשיטת SFT דרך TRL לחקירת נתונים, כתיבת קוד פייתון והרצת פקודות בסביבת מחברות.

  • הערכת ביצועי מודלי שפה

    מבחן ביצועים למודלים על שאלות ניתוח נתונים מורכבות והשוואת יכולות הפקת גרפים וחישובים.

  • כוונון מודלי חשיבה

    שימוש בתת המאגר thinking כדי לאמן מודלים לפלוט תהליכי מחשבה מפורטים לפני שליפת הקוד.

איפה זה נופל

כל התשובות ועקבות הריצה הם תוצרים סינתטיים של מודלים ממשפחת Qwen, ולכן ייתכנו בהם טעויות חישוב והזיות שלא נתפסו באימות. בנוסף, הקוד המקורי נשען על קוד פתוח של משתמשי קגל, מה שמכניס הטיות מקצועיות ותלויות בחבילות פייתון ספציפיות שלא בהכרח יציבות בכל סביבה. חשוב לדעת שחלק מהעקבות הופקו בהרצה מדומה ולא בארגז חול אמיתי. אין במאגר טקסט בעברית, כולו מבוסס קוד ואנגלית, ולא הייתי מריץ את הקוד המופק בסביבת ייצור ללא ארגז חול סגור ומאובטח.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר מוגדר ברישיון Apache 2.0 שמאפשר שימוש מסחרי ואימון מודלים חופשי. עם זאת, אם אתם מורידים את קובצי המקור מקגל לפי שמות המאגרים ברשומות, עליכם לוודא שהרישיון של כל קובץ מקורי אכן מתיר שימוש מסחרי.

האם הדאטהסט כולל את קובצי הנתונים עצמם מתוך קגל?

לא, המאגר אינו מפיץ מחדש את קובצי המידע או את המחברות המקוריות בשלמותן. הוא מכיל רק תוצרים נגזרים כמו שאלות, תשובות, מטא-דאטה ועקבות הרצה סינתטיים. כדי להריץ את הקוד מחדש על הדאטה האמיתי, יש למשוך אותו עצמאית דרך Kaggle Hub.

האם יש במאגר שאלות או קוד בעברית?

לא. המאגר מורכב כולו מקוד פייתון והסברים באנגלית בלבד. אם המטרה היא סוכן שמבין שאלות ניתוח נתונים בעברית, תצטרכו לתרגם את השאלות או לערבב אותו עם נתונים מקומיים.

מה ההבדל בין חלוקת thinking ל־non-thinking?

החלוקה נועדה להתאים למבנה המודל שאתם מאמנים. בגרסת thinking שלבי ההסקה והחשיבה של המודל עטופים בתגיות חשיבה ייעודיות, בעוד בגרסת non-thinking הטקסט מוגש ישירות ללא תיוג כזה.

איך טוענים

טוענים את המאגר ישירות מתוך ספריית datasets של Hugging Face תוך בחירת החלוקה הרצויה, thinking או non-thinking. אין צורך באישור גישה ידני או בהרשמה מוקדמת מעבר לחשבון רגיל. המידע שמור בקובצי Parquet, ועמודות המפתח הן messages בפורמט ChatML, tools לקריאות פונקציה, לצד שדות המטא-דאטה של שמות הקבצים והחבילות. אם תרצו לשחזר את ההרצות המקוריות, תצטרכו להוריד את קובצי הבסיס מקגל בנפרד דרך kagglehub ולהרים סביבת ריצה מבודדת כמו E2B.

from datasets import load_dataset

ds = load_dataset("jupyter-agent/jupyter-agent-dataset")

הרישיון

המאגר עצמו מופץ תחת רישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה, ואינו כופה פתיחת קוד על מודלים שמאומנים עליו, כל עוד שומרים על הודעת זכויות היוצרים. יחד עם זאת, הנתונים הם נגזרות של מחברות וקובצי מקור מקגל. אם אתם מושכים את קובצי המקור עצמם לצורך הרצה, חלים עליהם תנאי השימוש והרישיונות הפרטניים של יוצריהם המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗