GPT
S

SWE-bench_Lite

קוד פתוח

princeton-nlpרישיון לא דווח2024-03-19

אוסף של 300 בעיות אמיתיות מגיטהאב לבדיקת פתרון באגים אוטונומי. זו גרסה מצומצמת ומהירה שנועדה להעריך סוכני קוד בלי לשרוף שבועות של ריצות חישוב.

  • 111,740הורדות בחודש
  • 64לייקים

מה זה

המאגר מכיל 300 צמדים של אישיוז ו־Pull Requests מתוך 11 ריפוזיטוריז מוכרים בפייתון. הוא מבוסס על המאגר המלא של SWE-bench, שנועד לבחון אם מודלים מסוגלים לפתור תקלות תוכנה אמיתיות מההתחלה ועד הסוף. הבדיקה מול כל דוגמה מתבצעת על ידי הרצה של טסטים מתוך הריפו, כאשר השינויים שנכנסו ב־PR המקורי משמשים כמבחן התוצאה.

הקבצים מחולקים לשני ספליטים עיקריים של dev ו־test בפורמט Parquet. כל רשומה כוללת בעיקר את תיאור התקלה המקורי מתוך ה־issue ואת ה־base commit של הריפוזיטורי לפני שנכנס הפתרון, כך שהסוכן שלכם מקבל את הקוד במצבו השבור בדיוק כפי שהמפתח ראה אותו.

מתאים ל

  • הערכת סוכני קוד בפייתון

    בדיקת יכולת המודל לייצר תיקוני באגים אמיתיים שעוברים את הטסטים בריפו.

  • בנצ'מרק מהיר למודלים

    הרצה על 300 דוגמות בלבד כדי לקבל תוצאות השוואתיות בלי לחכות לבנצ'מרק המלא.

  • פיתוח כלי תיקון אוטונומיים

    אימון ובחינה של מערכות שמקבלות אישיו וצריכות לאתר את נקודת הכשל בקוד.

איפה זה נופל

ההערכה מוגבלת ל־11 פרויקטים בלבד, וכולם כתובים בפייתון. אם המוצר שלכם מיועד לשפות אחרות או למבני קוד ארגוניים מורכבים, הביצועים כאן לא יעידו עליהם ישירות. הטקסט ברובו באנגלית, והיוצרים מציינים במפורש שלא בוצע סינון או ניקוי מבוסס שפה, כך שייתכן רעש בתיאורים. מעבר לזה, המאגר מספק את התיאור והקומיט בלבד, כך שכל סביבת ההרצה, הקוד עצמו והרצת הטסטים דורשים תשתית נפרדת לחלוטין.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

לא דווח רישיון בעמוד המאגר, ולכן אין היתר רשמי לשימוש מסחרי. מעבר לזה, הנתונים מבוססים על קוד מ־11 פרויקטים שונים בגיטהאב שאיננו יודעים מה הרישיונות המקוריים שלהם. לשימוש במוצר אמיתי עדיף להיזהר ולהמתין לעדכון תנאי השימוש.

האם יש בדאטהסט תמיכה בעברית?

הטקסט של האישיוז הוא ברובו באנגלית. היוצרים ציינו שהם לא ביצעו שום סינון או ניקוי שפתי, כך שאם יש שם שפות אחרות זה רק במקרה ולא כחלק מתכנון המאגר.

איך הנתונים נאספו?

החוקרים אספו 300 צמדים של Issue ו־Pull Request מתוך 11 מאגרי פייתון פופולריים בגיטהאב. אימות הפתרון נשען על טסטים מקוריים שנכתבו במסגרת אותם PRs.

מה ההבדל בין הגרסה הזו לגרסאות האחרות של SWE-bench?

זו גרסה קלה ומצומצמת שמכילה רק 300 דוגמות בדיקה מתוך המאגר המקורי. בנוסף, היא כוללת רק את טקסט התקלה ואת הקומיט הבסיסי, בניגוד לגרסאות Oracle או BM25 שמכילות גם הקשר מסונן של קבצי הקוד הרלוונטיים.

איך טוענים

הנתונים שמורים בקובצי Parquet שזמינים להורדה ישירה דרך Hugging Face, ללא צורך באישור גישה מיוחד. המאגר כולל בסך הכל ארבעה קבצים, כולל ה־dev וה־test. השדות המרכזיים שמעניינים אתכם הם problem_statement שמכיל את תיאור התקלה ו־base_commit שמצביע על נקודת הזמן בריפו. שימו לב שהמאגר הזה מחזיק רק את הטקסט והקומיט הבסיסי, ואם אתם מחפשים קונטקסט ממוקד יותר כמו במחקרי אחזור, קיימות גרסאות נפרדות עם שליפה מבוססת BM25 או הגדרות Oracle.

from datasets import load_dataset

ds = load_dataset("princeton-nlp/SWE-bench_Lite")

הרישיון

בעמוד הדאטהסט לא דווח רישיון. המשמעות ברורה: מבחינה משפטית אין כרגע היתר שימוש מפורש, לא למחקר ולא לפיתוח מוצרים מסחריים. בנוסף, הנתונים והקוד נגזרו מ־11 פרויקטים שונים בגיטהאב שלכל אחד מהם עשוי להיות רישיון קוד פתוח משלו. מי שבונה מוצר מסחרי צריך לקחת בחשבון את הסיכון המשפטי הזה או לחכות להסדרת הרישוי על ידי פרינסטון.

הרישיון המלא ב־Hugging Face ↗