GPT
E

evol-codealpaca-v1

קוד פתוח

theblackcat102apache-2.02023-07-23

  • code

המאגר מרחיב משימות קוד קיימות להוראות מורכבות יותר באמצעות מודלים של GPT-4. הוא מתאים למי שרוצה לאמן מודל שפה לייצור קוד בלי להסתמך על דאטהסטים סגורים.

  • 8,458הורדות בחודש
  • 184לייקים

מה זה

הבסיס כאן הוא הדאטהסט CodeAlpaca_20K, שעבר תהליך אבולוציה והרחבה לפי המתודולוגיה של WizardCoder. המפתח השתמש בעשר אסטרטגיות שונות כדי לסבך את המשימות וליצור הוראות עמוקות ומאתגרות יותר, כשהמענה והשכתוב בוצעו באמצעות gpt-4-0314 ו־gpt-4-0613. רוב המידע נוצר על ידי גרסת 0314.

התוצאה היא אוסף של בין מאה אלף למיליון רשומות המיועדות למשימות יצירת טקסט וקוד, עם אורך רצף חציוני של 471 טוקנים. בהשוואה למאגרים דומים כמו Evol-Instruct-Code-80k-v1, הנתונים כאן כוללים הוראות ותשובות ארוכות יותר. הסינון הסופי ניקה אזכורים לכך שהתשובות הופקו על ידי מודלים של OpenAI והשאיר רק הוראות באנגלית נקייה.

מתאים ל

  • אימון מודלים להשלמת קוד

    כוונון עדין של מודלי בסיס דוגמת LLaMA-2 כדי ללמד אותם להבין הוראות תכנות מורכבות ולכתוב פתרונות ארוכים.

  • בדיקת שיטות אבולוציה

    שימוש בנתונים כבסיס להשוואה עבור אלגוריתמים חדשים שמשפרים ומסבכים הוראות באופן אוטומטי.

  • בניית מאגרי העדפה

    שילוב השאלות והתשובות בתהליכי יצירת דאטהסטים מדורגים כמו UltraFeedback עבור אימוני יישור והעדפת משתמש.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שאין כאן שום תמיכה בעברית או בהוראות רב-לשוניות, למעט גרסה נפרדת בסינית שפורסמה בפרויקט אחר. המידע מבוסס לחלוטין על סינתזה של מודלי GPT-4 מתחילת 2023, ולכן הוא סוחב איתו את ההטיות, ההזיות ומגבלות הידע של הגרסאות האלו מאותה תקופה. בנוסף, קוד שנוצר על ידי מודל בלי בדיקות קומפילציה בפועל עלול לכלול שגיאות תחביר או לוגיקה עדינות, וחשוב להריץ עליו מבחני איכות לפני שמשלבים אותו במודל שמיועד לסביבת עבודה אמיתית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוגדר במאגר הוא apache-2.0, שמתיר שימוש מסחרי בקבצים עצמם ללא דרישה לשיתוף קוד המקור שלכם. יחד עם זאת, הנתונים נוצרו בעזרת מודלים של OpenAI, כך שצריך לקחת בחשבון את תנאי השימוש של החברות שיצרו את המידע הסינתטי המקורי.

האם הדאטהסט כולל קוד או הוראות בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. באוגוסט 2023 בוצע סינון ייעודי שהשאיר אך ורק הוראות באנגלית נקייה, כך שאין בו דוגמאות בעברית או תמיכה מקומית.

במה הוא שונה ממאגרי קוד אחרים כמו CodeAlpaca המקורי?

ההוראות ב־CodeAlpaca המקורי היו קצרות ופשוטות יחסית. כאן נעשה שימוש בעשר אסטרטגיות הרחבה מבוססות GPT-4 כדי להפוך את המשימות למורכבות יותר, מה שמייצר טקסטים ותשובות באורך חציוני של 471 טוקנים.

מאיזה קבצים המאגר מורכב ואיך ניגשים למידע?

המאגר מכיל ארבעה קבצים, כשהקובץ העיקרי לעבודה הוא train.jsonl שמכיל את כל דוגמאות האימון. אין צורך בתהליך הרשמה או אישור מיוחד, ואפשר להוריד את הקובץ ישירות או לטעון אותו בקוד.

איך טוענים

המאגר פתוח לציבור ואינו דורש אישור גישה מיוחד. הקובץ המרכזי שמעניין אתכם לאימון הוא train.jsonl שנמצא במאגר, שבו מרוכזות הדוגמאות לעבודה. מכיוון שמדובר בקובץ JSONL סטנדרטי, אפשר לטעון אותו ישירות עם ספריית datasets הרגילה בלי צורך בהמרות מיוחדות. שווה לשים לב שהדאטהסט הזה נכנס כבר לפרויקטים אחרים כמו OpenHermes-2.5, כך שאם אתם משלבים כמה מקורות יחד, תצטרכו להריץ דה-דופליקציה כדי לא לאמן פעמיים על אותן השאלות בדיוק.

from datasets import load_dataset

ds = load_dataset("theblackcat102/evol-codealpaca-v1")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו הרישיון. תנאי הרישיון דורשים שמירה על הקרדיט והודעות הרישיון המקוריות, והיוצר מבקש בנוסף לצטט את מאמר הבסיס של WizardCoder אם אתם מאמנים מודלים על בסיס הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗