GPT
C

code_generation

קוד פתוח

livecodebenchcc2024-03-12

מאגר שאלות תכנות תחרותי שנועד לבחון ייצור קוד במודלים בלי חשש מזיהום נתונים. הוא כולל בעיות עדכניות עם בדיקות מקיפות כדי למדוד פתרונות אמיתיים.

  • 6,688הורדות בחודש
  • 31לייקים

מה זה

המאגר מציע 400 בעיות תכנות שנאספו ישירות משלוש פלטפורמות מוכרות: LeetCode, AtCoder ו־Codeforces. הרעיון הוא לתפוס בעיות תחרותיות שפורסמו בזמנים שונים כדי לבחון מודלים מול חומר שהם לא ראו באימון המקורי שלהם, תוך התמקדות באיכות הבעיות, ברמת הקושי ובאיכות מקרי הבדיקה.

כל רשומה כוללת את תיאור המשימה המלא, דוגמאות קלט ופלט בסיסיות, וסדרה של מקרי בדיקה נסתרים שמגיעים לממוצע של מעל 59 בדיקות לכל בעיה בודדת. בנוסף, הנתונים מתויגים לפי רמת הקושי של האתגר ותאריך הפרסום המקורי שלו בעולם, מה שמאפשר לבודד חלונות זמן שונים של ידע ולבדוק יכולות כמו יצירת קוד מאפס או תיקון עצמי בעזרת פידבק מטסטים.

מתאים ל

  • הערכת מודלי קוד

    בדיקת יכולת המודל לייצר פתרונות נכונים ויעילים לאתגרי קוד מורכבים.

  • מדידת תיקון עצמי

    בחינה של תיקון פתרונות שגויים באמצעות פידבק ממקרי הבדיקה הנסתרים.

  • בדיקת זיהום נתונים

    השוואת ביצועי המודל על בעיות לפי חלונות זמן ותאריכי הפרסום שלהן.

איפה זה נופל

ההיקף פה קטן ועומד על 400 שאלות בלבד, כך שהוא לא מתאים לאימון מודלים אלא בעיקר להערכה. הנתונים מגיעים מאתרי תחרויות, מה שאומר שהקוד והבעיות בעלי אופי אלגוריתמי מאוד ספציפי ולא משקפים פיתוח תוכנה יומיומי, ארכיטקטורה או תשתיות. הכרטיס גם לא מפרט תמיכה בשפות מעבר לאנגלית, כך שאין כאן בדיקה של הבנת שפות אחרות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

הרישיון מוגדר כ־cc כללי בלי פירוט של תתי-הסוגים. בגלל שהאותיות הקטנות לא מופיעות בכרטיס, לא ברור אם יש הגבלה מסחרית, וכדאי לבדוק במאגר הגיטהאב שלהם לפני שמשלבים אותו בעבודה עסקית.

באיזה גודל הדאטהסט הזה וכמה מקום הוא דורש?

המאגר מכיל פחות מ־1,000 רשומות, ובפועל יש בו 400 בעיות בלבד בקובץ jsonl יחיד. הוא שוקל מעט מאוד ויורד תוך שניות בודדות לכל סביבת עבודה.

האם יש בדאטהסט בעיות או הנחיות בעברית?

לא. השאלות נאספו מאתרים כמו LeetCode ו־Codeforces, ולכן כל התיאורים, הדוגמאות וההסברים כתובים באנגלית בלבד.

איך נאספו הנתונים שבפנים?

היוצרים אספו 400 אתגרים מאתרי תחרויות תכנות פופולריים. הם שמרו על חלוקה לרמות קושי, צירפו תאריכי שחרור, ודאגו לממוצע של מעל 59 מקרי בדיקה נסתרים לכל אתגר.

איך טוענים

הנתונים יושבים בקובץ test.jsonl פשוט בתוך המאגר, לצד קובצי תיעוד ותמונה, בלי צורך באישור גישה מיוחד או חתימה על טפסים. מדובר במאגר זעיר של פחות מאלף שורות, כך שהטעינה שלו זריזה במיוחד ואינה דורשת משאבי זיכרון חריגים. בעבודה איתו חשוב להשתמש בשדות של תיאורי הבעיות, מקרי הבדיקה הנסתרים והתאריכים כדי להריץ את הבדיקה נכון.

from datasets import load_dataset

ds = load_dataset("livecodebench/code_generation")

הרישיון

הרישיון המדווח הוא cc כללי, ללא ציון הגרסה המדויקת כמו BY או NC. במצב כזה אי אפשר לדעת בוודאות אם מותר להשתמש בו לצרכים מסחריים או מה חובת הייחוס והשיתוף. אם אתם מתכננים להשתמש בזה לבדיקת מוצר מסחרי, כדאי לברר את תנאי הרישיון המלאים במאגר הקוד של הפרויקט.

הרישיון המלא ב־Hugging Face ↗