GPT
O

opc-sft-stage2

קוד פתוח

OpenCoder-LLMmit2024-11-08

המאגר מרכז הוראות קוד וטסטים שנבדקו מול קומפיילר כדי לאמן מודלים בשלב השני של כוונון עדין. הוא מיועד למי שרוצה לשפר יכולות קידוד ולמידת חיזוק בלי לאסוף דאטה מאפס.

  • 3,901הורדות בחודש
  • 105לייקים

מה זה

הנתונים מחולקים לארבע תצורות נפרדות של הוראות לקוד. החלק הראשון מכיל שלשות של הנחיה, קוד ומקרי בדיקה שנוצרו מתוך קורפוס אלגוריתמי ואומתו בקומפיילר פייתון. חלק נוסף מתבסס על תיעוד ממשקים של ספריות פייתון כדי לייצר שאלות ותשובות סביב חבילות תוכנה מוכרות.

שני החלקים האחרים נשענים על מקורות קיימים בקוד פתוח. המפתחים שילבו כאן ישירות את הדאטהסט של מג'יק קודר שמכיל כ־110 אלף דוגמאות שעברו הרחבה, יחד עם נתונים מתוך פרויקט מק-איוואל. הכל מסודר בקובצי פארקט שמוכנים להזנה ישירה למודל שפה.

מתאים ל

  • כוונון מודלי שפה לקוד

    אימון הוראות מתקדם למודלי תכנות שכבר עברו אימון בסיסי וצריכים חיזוק בפתרון בעיות.

  • למידת חיזוק לקוד

    שימוש במקרי הבדיקה המאומתים כדי לספק ציון אמין למודל בתהליכי RL.

  • מענה על שאלות תיעוד

    אימון מודל לעבודה נכונה עם ממשקי ספריות פייתון על בסיס תיעוד רשמי.

איפה זה נופל

המאגר מוטה חזק מאוד לפייתון, במיוחד בחלקים שנסמכים על קומפיילר ותיעוד ספריות פנימי. אין בכרטיס שום תיעוד של תמיכה בעברית, כך שלא כדאי לבנות עליו לפקודות בשפה המקומית. בנוסף, חלק גדול מההוראות והטסטים נוצרו באופן סינתטי, וזה דורש בדיקה מדגמית כדי לוודא שאין שם פתרונות מומצאים לפני שדוחפים למודל בייצור.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון שמצורף הוא רישיון MIT מלא. הוא מאפשר שימוש מסחרי חופשי, כולל אימון מודלים שתמכרו בעתיד, בלי דרישה לחשוף את הקוד שלכם.

האם יש במאגר הוראות בשפה העברית?

לא, אין כאן התייחסות לעברית. כל הנתונים, התיעוד ומקרי המבחן מבוססים על אנגלית ועל שפות תכנות בלבד.

מאיפה הגיעו הנתונים במאגר?

המאגר משלב סינתזה של טקסט מקורפוס אלגוריתמי ותיעוד פייתון יחד עם שני מאגרים פתוחים מוכרים, MagicCoder ו־McEval. הנתונים הסינתטיים נבדקו ישירות מול קומפיילר כדי לאמת את תקינותם.

איך טוענים

אין כאן שום צורך לבקש אישור גישה מראש. טוענים את הנתונים ישירות דרך ספריית הדאטהסטס של האגינג פייס, אבל חייבים לציין את שם החלק הספציפי שרוצים למשוך כי המאגר מחולק לקונפיגורציות שונות. הקבצים נשמרים בפורמט פארקט יעיל, ומי שמתכנן לעבוד על שלב החיזוק צריך להתמקד בעיקר במקרי הבדיקה שמאומתים מול קומפיילר.

from datasets import load_dataset

ds = load_dataset("OpenCoder-LLM/opc-sft-stage2")

הרישיון

המאגר מופץ תחת רישיון MIT. המשמעות פשוטה: מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים פנימיים או מוצרים פתוחים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗