GPT
E

Evol-instruction-66k

קוד פתוח

codefuse-aicc-by-nc-sa-4.02023-09-07

  • code

המאגר מרכז כשישים ושש אלף הוראות קוד מורכבות שנועדו לכוונון מודלי שפה. הוא מציע גרסה מסוננת ונקייה יותר של מאגר קוד קיים, עם דגש על מניעת זליגה למבחני הערכה מקובלים.

  • 498הורדות בחודש
  • 75לייקים

מה זה

המאגר מבוסס על שיטת Evol-Instruct מתוך המאמר של WizardCoder, שנועדה לייצר הוראות קוד מורכבות ומאתגרות. הבסיס לנתונים הוא המאגר הפתוח Evol-Instruct-Code-80k-v1 שכלל שמונים אלף דוגמאות. הצוות סינן מתוכו כארבע עשרה אלף רשומות כדי להגיע לשישים ושש אלף דוגמאות איכותיות יותר.

כל רשומה מורכבת מהוראה (Instruction) ומענה (Output). המענה כולל בלוק קוד יחיד בפורמט Markdown לצד הסבר מילולי קצר. הסינון הראשוני הוריד הוראות קצרות מעשרה מילים או ארוכות מאלף, פלטים קצרים מחמישים מילים או ארוכים מאלפיים, וכן מקרים ללא קוד מסומן או עם מספר בלוקים שונים של קוד. כמו כן נפסלו דוגמאות עם פחות משלוש או יותר ממאה שורות קוד, ומקרים שבהם ההקדמה לפני הקוד עלתה על מאתיים מילים.

חלק משמעותי בתהליך הוקדש למניעת זליגה של מבחן HumanEval. הצוות הסיר כל דוגמה שכללה שם פונקציה מהמבחן. בנוסף, הם חילצו מילות מפתח מהתיעוד של HumanEval בעזרת NLTK וסיננו כל רשומה שחפפה ביותר מארבעים אחוז מהמילים הללו.

מתאים ל

  • כוונון מודל קוד מחקרי

    אימון מודלי קוד בקוד פתוח לצורכי מחקר והשוואת ביצועים מול שיטות כוונון אחרות.

  • אימון מודל פייתון בסיסי

    לימוד מודלים לפתור אלגוריתמים ומשימות חישוב מוגדרות הכוללות הסבר מלווה.

  • בדיקת השפעת סינון נתונים

    השוואת ביצועי המודל מול מאגר המקור בן 80k הדוגמאות לבחינת יעילות הסינון.

איפה זה נופל

הנתונים כולם באנגלית בלבד. אם אתם מחפשים קוד שמתועד בעברית או מיועד להבנת שאלות בשפות אחרות, המאגר הזה לא יספק את זה. מעבר לכך, הסינון הקשיח של הפורמט עלול לייצר מודל עם דפוס פעולה מאוד מקובע. המודל שיתאמן עליו ילמד לפלוט תמיד בלוק קוד יחיד באורך של שלוש עד מאה שורות עם פתיחה קצרה, ולא יתמודד טוב עם פתרונות מרובי קבצים או קטעי סקריפט זעירים. חשוב גם לזכור שהנתונים סוננו על בסיס חפיפה ל־HumanEval, אך אין מידע על סינון מבחני הערכה מודרניים אחרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-sa-4.0, והסעיף הלא מסחרי (NC) מונע כל שימוש במוצר שמייצר הכנסה או שייך לחברה מסחרית. מודל שתאמנו על הנתונים האלה יהיה כבול לאותן מגבלות.

האם יש במאגר תמיכה בעברית?

המאגר מוגדר וקיים באנגלית בלבד. כל ההוראות, השאלות וההסברים המלווים את הקוד נכתבו באנגלית, כך שאין בו דוגמאות או תמיכה ייעודית בעברית.

מה ההבדל בינו לבין המאגר המקורי של 80k?

המאגר הזה לוקח את Evol-Instruct-Code-80k-v1 ומסנן ממנו כארבע עשרה אלף דוגמאות בעייתיות. הסינון מסיר תשובות קצרות מדי, קוד ארוך ממאה שורות ודוגמאות שדומות מדי למבחן HumanEval.

האם המאגר דורש כוח חישוב חריג לעיבוד?

לא. מדובר בקובץ JSON יחיד שמכיל שישים ושש אלף רשומות. אפשר לטעון אותו, לסנן אותו או לשמור אותו מחדש על כל מחשב פיתוח רגיל תוך שניות בודדות.

איך טוענים

הנתונים יושבים בקובץ יחיד בשם Evol-Instruction-66k.json בתוך המאגר, שכולל בסך הכל חמישה קבצים. הגישה חופשית ואינה דורשת אישור מיוחד. המבנה מבוסס על שני שדות מרכזיים: Instruction ו־Output. גודל המאגר נמצא בטווח שבין עשרת אלפים למאה אלף רשומות, כך שאפשר לטעון אותו בקלות באמצעות ספריית datasets של Hugging Face או בקריאת JSON ישירה בזיכרון מקומי בלי צורך בתשתיות כבדות.

from datasets import load_dataset

ds = load_dataset("codefuse-ai/Evol-instruction-66k")

הרישיון

הרישיון המדווח הוא cc-by-nc-sa-4.0. המשמעות ברורה וחד משמעית: אסור לעשות במאגר שום שימוש מסחרי. מותר להשתמש בו למחקר, לימוד או פיתוח פנימי בלבד. כל תוצר שמבוסס עליו, כולל משקלי מודל שאומנו על הנתונים, מחייב מתן קרדיט ושיתוף תחת אותו רישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗