GPT
A

AceCode-87K

קוד פתוח

TIGER-Labmit2025-02-03

  • acecode
  • code

מאגר שמביא עשרות אלפי שאלות קוד עם בדיקות תוכנה מסוננות ותוצאות הרצה של מודלים. הוא נועד למי שמאמן מודלי תגמול או מריץ למידת חיזוק על יצירת קוד.

  • 4,487הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל עשרות אלפי רשומות שמיועדות לאימון מודלים בתחום התכנות, בדגש על בדיקות אמינות לתגמול. הבסיס נלקח ממאגרי קוד קיימים, אך עבר הרחבה שבה מודלי שפה גדולים יצרו מקרי בדיקה עבור כל בעיה, וסינון קפדני ניקה בדיקות שגויות או מרעישות. בנוסף, כל שאלה שוכתבה באמצעות GPT-4o-mini כדי לשפר את הניסוח, ומצורפים אליה בממוצע 16 מקרי בדיקה נקיים.

מבנה הנתונים מחזיק את מזהה השאלה, המקור שלה, נוסח השאלה, ומערך של מקרי הבדיקה. החלק המעניין נמצא בשדה ההרצות, שמכיל פתרונות שנלקחו ממודלי קוד קיימים, לצד שם המודל, אחוזי המעבר של הטסטים והתוצאה המדויקת של כל בדיקה ובדיקה. יש כאן גם שדה של שיחות קודמות שמסודר לפי תפקידים, כדי להזין את הנתונים ישירות לתהליכי כוונון.

מתאים ל

  • אימון מודלי תגמול

    שימוש בתוצאות הריצה ובאחוזי המעבר של הבדיקות כדי ללמד מודל להעריך איכות של פתרונות קוד שונים.

  • למידת חיזוק לקוד

    חיבור ישיר למערכות כמו OpenRLHF באמצעות שדה השיחות והטסטים כדי לשפר ביצועי מודל שפה בתכנות.

  • הערכת מודלי פיתוח

    בדיקת יכולת הפתרון של מודלים חדשים מול עשרות אלפי שאלות קוד ומקרי בדיקה קיימים ומסוננים.

איפה זה נופל

המידע מבוסס על שכתובים ובדיקות שנוצרו על ידי מודלים סינתטיים, בעיקר GPT-4o-mini, כך שהטיות או עיוורון של המודל המייצר נכנסו ישירות לטסטים. המאגר מוגדר כולו באנגלית בלבד, ואין בו שום התייחסות לעברית או לתיעוד מקומי. אם אתם בונים מוצר שצריך לעבוד עם ספריות חדשות, קחו בחשבון שהידע מוגבל לתאריכי האימון של מודלי הבסיס, ושיש לבדוק ידנית מדגם של מקרי הבדיקה לפני שמסתמכים עליהם כמדד אמת בארגון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן הוא מתיר שימוש מסחרי מלא. הדרישה העיקרית היא לכלול את הצהרת הרישיון ומתן הקרדיט ליוצרים המקוריים.

האם יש במאגר תמיכה בשפה העברית?

לא. כל השאלות, ההנחיות והקוד כתובים באנגלית בלבד. אם המערכת שלכם מיועדת לעבוד מול מפתחים שכותבים הנחיות בעברית, המאגר הזה לא יספק נתונים מתאימים בלי תרגום.

מאיפה הגיעו הפתרונות ומקרי הבדיקה?

החוקרים לקחו שאלות ממאגרי קוד קיימים, יצרו עבורן מקרי בדיקה אוטומטיים דרך מודלי שפה, וסיננו רעשים. הפתרונות עצמם נדגמו ממודלי קוד קיימים ונבדקו מול אותם מקרי בדיקה כדי למדוד אחוזי הצלחה.

איך המאגר הזה שונה ממאגרי שאלות קוד רגילים?

בניגוד לאוסף קוד רגיל, יש כאן לכל שאלה ממוצע של 16 בדיקות נקיות ותוצאות הרצה בפועל של מודלים אחרים. המטרה שלו היא לא רק לראות קוד שנכתב, אלא לספק מערך בדיקה שאפשר לאמת איתו ביצועים.

איך טוענים

טוענים את הנתונים ישירות בספריית datasets של פייתון דרך הפקודה load_dataset עם ציון המזהה של המאגר. המאגר ציבורי ואינו דורש אישור גישה מיוחד. כלל המידע שמור בפורמט Parquet שמחולק לאחד עשר קבצים שונים תחת תיקיית המידע, לכן כדאי לקחת בחשבון את הזמן שלוקח למשוך את כל החלקים. השדות הקריטיים לעבודה הם שאלת הקוד, מערך הטסטים, ושדה השיחות שמשמש מפתח ישיר לספריות למידת חיזוק כמו OpenRLHF.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/AceCode-87K")

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה ושילוב במערכות סגורות, תחת הדרישה היחידה של מתן ייחוס ושמירה על הודעת הרישיון המקורית. אין חובה לשתף את הקוד הנגזר או את המודלים שתאמנו עליו באותו רישיון חופשי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗