GPT
A

AIDev

קוד פתוח

hao-licc-by-4.02025-07-25

מאגר נתונים מקיף של בקשות משיכה שנוצרו על ידי סוכני פיתוח עצמאיים בגיטהאב. הוא מרכז מיליוני שינויי קוד ודיונים כדי לחקור או לאמן מודלים על עבודה אמיתית של סוכני תוכנה.

  • 6,221הורדות בחודש
  • 45לייקים

מה זה

המאגר כולל 2,743,854 בקשות משיכה מתוך 327,477 מאגרים בגיטהאב, שנאספו עד נובמבר 2025. הנתונים מתעדים פעילות של שישה סוכני קוד: OpenAI Codex, GitHub Copilot, Cursor, Google Jules, Devin ו־Claude Code, לצד אינטראקציות עם 159,056 מפתחים אנושיים.

המבנה מאורגן בטבלאות מקושרות בפורמט Parquet. ברמת המאגר המלא קיימות טבלאות של בקשות משיכה, מאגרים ומשתמשים שמהם הוסר מידע מזהה אישי. עבור תת-קבוצה בשם AIDev-pop, שמסננת מאגרים פופולריים עם מעל 100 כוכבים, נוספו טבלאות של תגובות, סקירות קוד, הערכות פנימיות והבדלי קוד של קומיטים.

מתאים ל

  • אימון מודלים וסוכנים

    כוונון עדין של מודלי שפה על בסיס שינויי קוד וטלאים שנכתבו על ידי סוכני תכנה שונים.

  • הערכת ביצועי סוכנים

    מדידת אחוזי המיזוג, איכות הקוד ויכולת תיקון שגיאות של סוכנים מול מפתחים אנושיים.

  • חקר אינטראקציית אדם ומכונה

    ניתוח תהליכי סקירת קוד, דיונים ודינמיקת המשוב בין מתכנתים אנושיים לשינויי קוד של סוכנים.

איפה זה נופל

ההטיה הבולטת ביותר היא החלוקה בין הסוכנים: מעל שני מיליון בקשות משיכה שייכות ל־OpenAI Codex בלבד, בעוד שלסוכנים חדשים כמו Claude Code יש רק 18,232 רשומות. בנוסף, הנתונים הוגבלו במקור עד נובמבר 2025. יש לשים לב שההבדלים הגדולים בקוד חסרים, כיוון שממשק ה־API של גיטהאב לא סיפק שינויים נרחבים בטבלת ה־patch, ומי שזקוק להם ייאלץ להוריד אותם עצמאית. כמו כן, אין תיעוד ייעודי לתמיכה בשפות שאינן אנגלית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר מופץ ברישיון CC-BY 4.0, אך חלקי הקוד עצמם כפופים לרישיונות המקוריים של המאגרים מהם נאספו. שימוש מסחרי בקוד מחייב סינון של מאגרים עם רישיונות מגבילים, כמו משפחת רישיונות GPL.

כמה נפח המאגר תופס והאם קל לטעון אותו?

הקבצים המרכזיים שוקלים יחד קרוב לשלושה גיגה-בייט במצב דחוס על הדיסק, כאשר טבלת הבקשות שוקלת כ־1.5 גיגה-בייט ופרטי הקומיטים כ־1.3 גיגה-בייט. טעינה מלאה שלהם לזיכרון עלולה להפיל את התוכנה, ולכן מומלץ לקרוא רק עמודות נבחרות או להשתמש בהזרמת נתונים.

איך הנתונים נאספו ומאיפה?

הנתונים נאספו מפעילות אמיתית במאגרים פתוחים בגיטהאב עד נובמבר 2025. הם כוללים בקשות משיכה שנוצרו על ידי שישה סוכנים שונים, ומידע מזהה הוסר מטבלאות המשתמשים כדי לשמור על פרטיות.

האם יש במאגר שינויי קוד גדולים?

לא. ממשק ה־API של גיטהאב אינו מספק שינויי קוד גדולים בטבלת ה־patch. אם המחקר שלכם תלוי בהבדלי קוד נרחבים, תצטרכו להוריד אותם ישירות מגיטהאב לפי מזהי הקומיטים.

איך טוענים

הקבצים שמורים בפורמט Parquet ונגישים ישירות ללא צורך באישור גישה מיוחד. הטבלאות הקטנות, כמו רשימת המשתמשים או המאגרים, נטענות ישירות ב־Pandas. לעומת זאת, הטבלה all_pull_request שוקלת כ־1.5 גיגה-בייט וטבלת pr_commit_details שוקלת כ־1.3 גיגה-בייט על הדיסק, כך שטעינה מלאה שלהן תעמיס על הזיכרון. מומלץ לטעון רק עמודות ספציפיות כמו agent או merged_at, או לעבד אותן במנות קבועות באמצעות PyArrow.

from datasets import load_dataset

ds = load_dataset("hao-li/AIDev")

הרישיון

המאגר עצמו מדווח תחת רישיון CC-BY 4.0, שדורש מתן קרדיט ליוצרים. עם זאת, היוצרים מדגישים שכל קוד, קובץ או טלאי שנאסף שומר על הרישיון המקורי של המאגר שממנו הוא נלקח בגיטהאב, כמו GPL, Apache או MIT. אם אתם מאמנים מודל על הקוד עצמו, אי אפשר להסתמך רק על רישיון המאגר, וחובה לוודא שהרישיונות המקוריים בכל מאגר מתירים שימוש כזה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗