GPT
O

opc-annealing-corpus

קוד פתוח

OpenCoder-LLModc-by2024-11-12

קורפוס שנועד לשלב ה־annealing באימון מודלי קוד, ומשלב אלגוריתמיקה אמיתית עם דאטה סינתטי. הוא כולל קוד מסונן מ־The Stack v2 לצד שכתובים ושאלות ותשובות שנוצרו על בסיסו.

  • 2,025הורדות בחודש
  • 44לייקים

מה זה

המאגר מחולק לשלושה חלקים עיקריים שנועדו לחזק מודלים לקראת סוף שלב האימון המקדים. החלק הראשון מכיל קוד אלגוריתמי שנדגם מתוך The Stack v2. שני החלקים הנוספים מבוססים כולו על סינתזה של החלק הראשון, במטרה להעלות את איכות הנתונים.

החלקים הסינתטיים כוללים קטעי קוד משוכתבים ברמה גבוהה וצמדי שאלות ותשובות שנבנו מאותם זרעי אלגוריתמים. לפי מפתחי הפרויקט, הניסויים שלהם הראו שהדאטה הסינתטי הזה משפר ביצועים, אך הכרטיס אינו מפרט את אופן הסינון המדויק או את הפרומפטים ששימשו ליצירת השאלות והתשובות מעבר להפניה למאמר המלא.

מתאים ל

  • שלב annealing באימון

    חיזוק יכולות הקוד של מודל שפה לקראת סוף תהליך האימון המקדים.

  • אימון מודלים על שאלות ותשובות

    שימוש בצמדי ה־QA הסינתטיים לשיפור היכולת להסביר ולנתח קוד.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של שכתוב קוד אלגוריתמי על ביצועי מודלי תכנות.

איפה זה נופל

המאגר מבוסס בחלקו הגדול על תוכן סינתטי שנוצר ממודלים, כך שהוא עלול לשכפל הזיות או טעויות לוגיות עדינות שהיו במודל המייצר. הדאטה מתמקד בקוד ובאלגוריתמיקה, ללא כל עדות לנוכחות של שפות טבעיות מלבד אנגלית, ובפרט אין בו עברית. בנוסף, חלקי הקוד נדגמו מ־The Stack v2, שכולל מגבלות רישוי ומקור מגוונות שחייבים לבדוק לעומק לפני שילוב במוצר מסחרי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

הרישיון המדווח הוא odc-by, שמאפשר שימוש מסחרי כל עוד מייחסים את היצירה למפרסמים. עם זאת, מכיוון שהקוד נדגם מ־The Stack v2, כדאי לוודא שאין התנגשות עם הרישיונות המקוריים של המאגרים שמהם נלקח הקוד.

האם המאגר כולל תוכן בעברית?

הכרטיס אינו מזכיר עברית כלל. התוכן מורכב מקוד מקור באנגלית ומתוכן סינתטי שנוצר סביבו, כך שאין לצפות לכיסוי של שפות שאינן אנגלית.

מאיפה הגיעו הנתונים של המאגר?

הבסיס הוא קוד אלגוריתמי שנדגם מתוך The Stack v2. על בסיס הקוד הזה יצרו המפתחים קטעי קוד משוכתבים וצמדי שאלות ותשובות באמצעות מודלים.

כמה המאגר שוקל ובאיזה פורמט הוא מגיע?

המאגר כולל 193 קבצים ומאורגן בקובצי jsonl לפי תיקיות החלוקה. הנפח הכולל בדיסק אינו מצוין בכרטיס המאגר, אך ניתן לבדוק קובץ דוגמה בודד לפני הורדה מלאה.

איך טוענים

הדאטהסט מורכב מ־193 קבצים, רובם קובצי jsonl שמחולקים לפי תיקיות של תתי-המאגרים, כמו algorithmic_corpus. אין צורך באישור גישה מיוחד כדי להוריד אותו מ־Hugging Face, ואפשר לטעון אותו ישירות באמצעות ספריית datasets הרגילה. גודל הנפח הכולל של הקבצים ושמות השדות המדויקים בתוך ה־JSON אינם מפורטים בעמוד המאגר, ולכן כדאי להוריד קובץ בודד לבדיקה לפני שמתחילים משיכת נתונים מלאה.

from datasets import load_dataset

ds = load_dataset("OpenCoder-LLM/opc-annealing-corpus")

הרישיון

המאגר מופץ תחת רישיון odc-by. מותר להשתמש בו לצרכים פנימיים ומסחריים, כולל אימון מודלים, בתנאי שנותנים קרדיט מתאים ליוצרים ומציינים את הרישיון. אין חובת שיתוף באותו רישיון עבור תוצרים או מודלים שאומנו עליו.

הרישיון המלא ב־Hugging Face ↗