GPT
S

Scale-SWE

קוד פתוח

AweAI-Teamרישיון לא דווח2026-02-26

מאגר משימות הנדסת תוכנה אמיתיות מגיטהאב הכולל סביבות דוקר וטסטים להרצה. הוא נועד למי שרוצה לאמן סוכני קוד על דוגמאות פתרון בעיות שניתן לבדוק פיזית.

  • 2,472הורדות בחודש
  • 43לייקים

מה זה

הנתונים נאספו ממעל שישה מיליון בקשות משיכה ויותר מ־23,000 מאגרים בגיטהאב, כשהגרסה הנוכחית מכסה 5,200 מאגרים. לפי הכרטיס מתוכננים מאה אלף מקרים, אך בשחרור הנוכחי פורסמו 20,000 משימות שניתנות להרצה מלאה יחד עם 71,000 מסלולי זיקוק ממודל DeepSeek v3.2 שמכילים 3.5 מיליארד טוקנים.

כל רשומה מייצגת תקלה אמיתית וכוללת תיאור של הבעיה, מזהי קומיט, כתובת תמונת דוקר מוכנה, התיקון המקורי ופקודות הכנה. מאחר שחלק מהמפתחים המקוריים לא כתבו בדיקות כושלות, הצוות שילב טסטים שכתבו המפתחים לצד סקריפטים סינתטיים שיצר סוכן כדי לבדוק שהתיקון עובד ואין רגרסיה.

מתאים ל

  • אימון סוכני קוד בזיקוק

    שימוש במסלולי הריצה מבוססי DeepSeek v3.2 לאימון מודלים קטנים לפתרון באגים מורכבים.

  • הערכת ביצועי מודלים בפייתון

    בדיקת יכולת תיקון תקלות בסביבות הרצה אמיתיות באמצעות תמונות דוקר ובדיקות ייעודיות.

  • מחקר על יצירת טסטים

    בחינת איכות הטסטים הסינתטיים שנוצרו על ידי סוכן מול טלאי בדיקה מקוריים של מפתחים.

איפה זה נופל

שפת התכנות היחידה שנתמכת כרגע היא פייתון בלבד. בנוסף, חלק מבדיקות האימות אינן מקוריות אלא סקריפטים סינתטיים שנוצרו על ידי סוכן חיצוני, מה שעלול לייצר אי דיוקים בהערכה. המאגר מכיל רק חלק קטן מההיקף המתוכנן, והרצה שלו דורשת תשתית דוקר כבדה לתמיכה במכולות שונות.

אותה משפחה

Scale-SWE יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

בתיעוד עצמו כתוב שהפרויקט תחת CC BY 4.0 שמתיר שימוש מסחרי עם מתן קרדיט. יחד עם זאת, במטה-דאטה של הדף הרישיון מוגדר כלא דווח. אם אתם בונים מוצר מסחרי, מומלץ לוודא את הסטטוס ישירות מול היוצרים לפני השקעת משאבי אימון.

האם יש במאגר תמיכה בשפות מעבר לפייתון או בעברית?

כרגע שפת הקוד יחידה במאגר היא פייתון בלבד, כפי שמוגדר במפורש בשדה השפה. אין תמיכה בשפות תכנות נוספות, ותיאורי הבעיות נלקחו ממאגרי גיטהאב באנגלית ללא נתונים בעברית.

מה ההבדל בין f2p_patch לבין f2p_script ברשומות?

השדה f2p_patch מכיל בדיקות מקוריות שכתבו המפתחים בגיטהאב ונכשלו לפני התיקון. השדה f2p_script נוצר על ידי סוכן מלאכותי עבור מקרים שבהם המפתחים לא צירפו בדיקות כאלה, והוא מיועד להרצה כקובץ בדיקה חיצוני כדי לוודא שהתקלה נפתרה.

כמה משימות זמינות כרגע להורדה?

הכרטיס מציג יעד של מאה אלף מקרים, אך בשחרור הנוכחי זמינות 20,000 משימות שניתנות להרצה. לצידן שוחררו 71,000 מסלולי ריצה שנוצרו על ידי מודל DeepSeek v3.2 בהיקף של 3.5 מיליארד טוקנים.

איך טוענים

הקובץ המרכזי שמופיע במאגר הוא processed_to_upload.jsonl, לצד קובץ התיעוד. הגישה פתוחה ואין צורך באישור מיוחד. הרצת הערכה בפועל דורשת משיכת תמונות הדוקר לפי השדה image_url והרצת פקודות ההכנה בשדה pre_commands בכל קונטיינר. להרצת בדיקות צריך להחיל את הטלאים מהשדות f2p_patch או ליצור קובץ מסקריפט f2p_script, באמצעות סקריפט הערכה ייעודי שמספק הצוות.

from datasets import load_dataset

ds = load_dataset("AweAI-Team/Scale-SWE")

הרישיון

בעמוד המאגר מופיע כי הרישיון לא דווח רשמית, אך בתוך התיעוד והתגים מצוין רישיון CC BY 4.0. רישיון זה מתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים קרדיט מלא ליוצרים, ואינו מחייב שיתוף תחת אותו רישיון. עם זאת, אי התאמה בין נתוני המטא לא מותירה ודאות משפטית מוחלטת למוצר מסחרי סגור.

הרישיון המלא ב־Hugging Face ↗