GPT
M

mbpp

קוד פתוח

google-research-datasetscc-by-4.02022-03-02

  • code-generation

כאלף בעיות פייתון בסיסיות שנכתבו ידנית יחד עם בדיקות תוכנה אוטומטיות. החבילה מתאימה לבדיקה מהירה של יכולות כתיבת קוד במודלי שפה, בלי להסתבך עם ספריות נדירות.

  • 506,035הורדות בחודש
  • 239לייקים

מה זה

המאגר מכיל תיאורי משימות באנגלית, פתרונות תקניים בפייתון ושלוש בדיקות תוכנה מסוג אסרשן לכל בעיה. הנתונים נאספו בגוגל באמצעות מיקור המונים פנימי, במטרה לבחון ידע של מתכנתים מתחילים בספרייה הסטנדרטית וביסודות השפה, במקום שאלות אלגוריתמיות מסובכות.

הקוד מחולק לשתי גרסאות מרכזיות. הגרסה המלאה כוללת קרוב לאלף רשומות, מתוכן 974 מוגדרות לבדיקה, לצד שדות שמכילים בדיקות מאתגרות יותר. הגרסה השניה נקראת סניטייזד, ובה 427 משימות שעברו סבב הגהה ותיקון אנושי נוסף לשיפור הניסוח של ההוראות. לכל גרסה יש חלוקה לאימון, הערכה, בדיקה ודוגמאות לפרומפטים.

מתאים ל

  • הערכת מודלי שפה לקוד

    בדיקת איכות הקוד שהמודל מייצר מול שלוש בדיקות יחידה אוטומטיות לכל שאלה.

  • בניית פרומפטים מעטים

    שימוש בחלק הפרומפטים המובנה כדי לספק למודל דוגמאות פתורות בזמן ריצה.

  • אימון מודלים זעירים

    אימון או כוונון עדין של מודלים קטנים על פתרון תרגילי פייתון פשוטים.

איפה זה נופל

היוצרים מודים שניסוחי המשימות בגרסה המלאה לא תמיד מספיק ברורים כדי לפתור את הבעיה, ולכן נדרש הסינון הידני בחלק מהמקרים. כל המשימות באנגלית בלבד ועוסקות רק בפייתון בסיסי, כך שאין כאן מענה לפיתוח מערכות שלמות. כמו כן, הרצת בדיקות מול קוד שנוצר על ידי מודל דורשת סביבה מבודדת ומאובטחת כדי לא להריץ פקודות מזיקות על המחשב שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון סי סי ביי 4.0 מתיר שימוש מסחרי חופשי. החובה היחידה היא מתן קרדיט ראוי לחוקרי גוגל שיצרו את המאגר ולציין אם בוצעו בו שינויים.

האם יש במאגר תמיכה בעברית?

לא. כל ההוראות והתיאורים מנוסחים באנגלית בלבד, וכל הפתרונות כתובים בקוד פייתון.

מה ההבדל בין הגרסה המלאה לגרסת הסניטייזד?

הגרסה המלאה מכילה קרוב לאלף בעיות אך חלק מהניסוחים בה עמומים. גרסת הסניטייזד מכילה 427 בעיות שעברו בדיקה ידנית נוספת ותיקון ניסוחים כדי לוודא שניתן לפתור אותן בוודאות.

כמה מקום המאגר תופס?

המאגר קטן מאוד ושוקל מגה בייטים בודדים. הוא מכיל בסך הכל כעשרה קובצי פארקט ופחות מאלף רשומות, כך שהוא יורד ונטען תוך שניות בודדות.

איך טוענים

טוענים את המאגר ישירות עם פונקציית לואוד דאטהסט של האגינג פייס, כשאפשר לבחור בין הגרסה הרגילה לגרסת הסניטייזד. הנתונים שמורים בקובצי פארקט קטנים מאוד, בלי דרישה לאישורי גישה מיוחדים. השדות החשובים הם הטקסט שמכיל את תיאור המשימה, שדה הקוד לפתרון, ומערך הבדיקות שמריצים מול התוצר של המודל.

from datasets import load_dataset

ds = load_dataset("google-research-datasets/mbpp")

הרישיון

הרישיון הוא סי סי ביי 4.0. מותר להשתמש בנתונים למטרות מסחריות, לשנות אותם ולשלב אותם בכל פרויקט, בתנאי שנותנים קרדיט מתאים ליוצרים ומציינים אם בוצעו שינויים. הרישיון לא דורש שיתוף תחת אותם תנאים, כך שאין בעיה לאמן מודלים סגורים על בסיס הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗