GPT
O

opc-sft-stage1

קוד פתוח

OpenCoder-LLMmit2024-11-08

מאגר הוראות קוד שנועד לשלב הראשון באימון מודלים מבוססי קוד. הוא משלב שאלות ממשתמשים אמיתיים לצד הרחבות סינתטיות כדי לבנות בסיס חזק למענה על בעיות תכנות.

  • 2,512הורדות בחודש
  • 76לייקים

מה זה

המאגר מורכב משלושה חלקים שנאספו ממקורות שונים כדי לכסות צרכי פיתוח מגוונים. החלק הראשון נקרא realuser_instruct, והוא מכיל שאלות דו לשוניות שנלקחו מתוך היסטוריות שיחה אמיתיות כמו ShareGPT ו־WildChat. היוצרים מציינים שהתשובות המקוריות הנמוכות שוכתבו מחדש, והשימוש בבקשות של משתמשים אמיתיים תורם ישירות לביצועים בעולם האמיתי.

החלק השני, filtered_infinity_instruct, מבוסס על סינון תכני קוד מתוך Infinity-Instruct באמצעות מודל שפה. החלק השלישי הוא largescale_diverse_instruct, שנוצר דרך תהליך הפקה אוטומטי המבוסס על זרעים מתוך CommonCrawl וקוד מקור, ומטרתו לספק מגוון רחב של הוראות קוד מורכבות ומגוונות.

מתאים ל

  • אימון שלב ראשון למודלי קוד

    לימוד מודל שפה להבין הוראות תכנות ולענות על שאלות קוד מגוונות.

  • התאמה לשאלות משתמשים

    שימוש בחלק של משתמשים אמיתיים לשיפור המענה על ניסוחים אנושיים יומיומיים.

  • ייצור נתונים סינתטיים מחדש

    שימוש בהוראות הקיימות כדי להפיק תשובות איכותיות יותר בעזרת מודל חיצוני.

איפה זה נופל

היוצרים מודים במפורש שהפלט המקורי בחלק של Infinity-Instruct היה באיכות נמוכה, עם תשובות קצרות מדי ועיצוב קוד לא עקבי, והם ממליצים לייצר את התשובות מחדש בעזרת מודל חזק יותר. בנוסף, הנתונים הם דו לשוניים אך הכרטיס אינו מפרט מעבר לכך או מזכיר תמיכה בעברית, ולכן צריך לבדוק היטב את איכות התשובות וההטיות לפני שמשלבים אותם במערכת פעילה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון המדווח הוא mit ולכן אין מניעה חוקית להשתמש בנתונים לפיתוח מסחרי. יש לוודא ששומרים על הודעת זכויות היוצרים המקורית בהתאם לתנאי הרישיון.

האם הדאטהסט כולל תמיכה בעברית?

התיעוד מציין שהנתונים דו לשוניים אך לא מפרט אילו שפות כלולות מעבר לאנגלית ולשפה נוספת. עברית לא מוזכרת בכרטיס המאגר, ולכן כדאי להניח שאין כאן כיסוי סביר לשפה זו.

מאיפה נאסף המידע שבתוך המאגר?

המידע מגיע משלושה מקורות שונים. חלק אחד נלקח משיחות משתמשים אמיתיות ב־ShareGPT ו־WildChat, חלק שני סונן ממאגר Infinity-Instruct, והחלק השלישי הופק מזרעי מידע של CommonCrawl וקוד מקור פתוח.

איך טוענים

טוענים את המידע ישירות באמצעות ספריית datasets של Hugging Face, לפי שלוש התצורות השונות: realuser_instruct, filtered_infinity_instryuct או largescale_diverse_instruct. הנתונים שמורים בקובצי parquet שמחולקים לחלקים, למשל 13 קבצים עבור החלק המגוון וארבעה קבצים עבור הסינון מ־Infinity. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים.

from datasets import load_dataset

ds = load_dataset("OpenCoder-LLM/opc-sft-stage1")

הרישיון

המאגר מופץ תחת רישיון mit. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במודלים חדשים, כל עוד שומרים על תנאי הרישיון ומתן הקרדיט המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗