GPT
H

humaneval-x

קוד פתוח

zai-orgapache-2.02022-09-20

מבחן ביצועים של 820 משימות תכנות בחמש שפות שונות, שנכתבו בידי אדם עם בדיקות תקינות צמודות. מתאים למי שרוצה לבדוק יכולות יצירת קוד ותרגום מעבר לפייתון בלבד.

  • 2,657הורדות בחודש
  • 97לייקים

מה זה

המאגר כולל 820 בעיות קידוד שנכתבו בידי אדם כדי לבדוק יכולות של מודלים בריבוי שפות. הוא מחולק לחמש שפות תכנות שונות: פייתון, פלוס פלוס C, ג'אווה, ג'אווה סקריפט ו־Go. בכל אחת מהשפות האלה יש בדיוק 164 משימות, והן מאורגנות תחת פיצול יחיד של בדיקה, ללא חלוקה מובנית של אימון או וולידציה.

כל רשומה מגיעה בפורמט מובנה שכולל מזהה משימה, פרומפט עם הצהרת הפונקציה והתיעוד שלה, וכן שדה הצהרה נפרד שמיועד למשימות תרגום קוד. לצד אלה תמצאו פתרון קנוני שנכתב ידנית, בדיקות מוסתרות שמשמשות להרצה ולהערכה, ובדיקות לדוגמה שמופיעות ישירות בתוך הפרומפט.

מתאים ל

  • בדיקת מודלים בריבוי שפות

    הרצת מבחני ביצועים זהים על פייתון, ג'אווה, Go ושפות נוספות כדי להשוות איכות.

  • תרגום קוד אוטומטי

    שימוש בשדה ההצהרה והפתרונות הקנוניים לבדיקת תרגום של אותה לוגיקה בין שפות.

  • אימות יצירת פונקציות

    בדיקה אוטומטית של קוד שנוצר בעזרת טסטים מובנים ומוסתרים לכל בעיה.

איפה זה נופל

יש פה רק 164 בעיות בכל שפה, כך שזה לא מתאים לאימון מודלים אלא רק לבנצ'מרק נקודתי. המאגר מוגבל אך ורק לחמש שפות התכנות שהוגדרו, בלי שום שפות טבעיות נוספות ובלי עברית. בנוסף, מדובר בבעיות פונקציונליות עצמאיות שנכתבו עד ספטמבר 2022, ולא במערכות קוד מורכבות או בפרויקטים שלמים מרובי קבצים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא Apache 2.0 שמאפשר שימוש מסחרי מלא בלי תשלום. אתם רק צריכים לשמור על הודעת זכויות היוצרים והעתק הרישיון בכל שימוש. אין מגבלה על מכירת מוצר שהוערך בעזרת הנתונים האלה.

האם יש במאגר תמיכה בעברית?

לא, אין בו עברית בכלל. כל ההוראות והתיעוד בתוך הפרומפטים נכתבו באנגלית בלבד. הנתונים מיועדים לבדיקת שפות תכנות ולא שפות טבעיות.

במה הוא שונה מ־HumanEval הרגיל של OpenAI?

הגרסה המקורית של OpenAI בדקה אך ורק קוד בפייתון. הפרויקט הזה לקח את המבנה והרחיב אותו ל־C++, ג'אווה, ג'אווה סקריפט ו־Go עם 164 בעיות בכל שפה. כך אפשר לבדוק אם מודל מבין מבני נתונים בשפות סטטיות ודינמיות שונות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets, אבל חייבים לבחור תת קבוצה ספציפית מתוך הרשימה, אחרת ברירת המחדל תטען רק את פייתון. הגישה חופשית לגמרי בלי צורך באישורים מיוחדים, והקבצים שמורים כקובצי jsonl לפי שפה. כשמריצים בדיקות, השדות החשובים הם הפרומפט לצורך יצירה והטסטים להרצה בפועל מול הפתרון שהמודל מייצר.

from datasets import load_dataset

ds = load_dataset("zai-org/humaneval-x")

הרישיון

הרישיון הוא Apache 2.0, מה שמאפשר שימוש מסחרי, שינוי והפצה חופשית. אתם מחויבים לכלול ייחוס למפתחים המקוריים ואת עותק הרישיון, אבל אין דרישה לשתף תוצרים או מודלים שנבדקו תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗