GPT
C

CodeExercise-Python-27k

קוד פתוח

codefuse-aicc-by-nc-sa-4.02023-09-07

  • code

עשרים ושבעה אלף תרגילי פייתון באנגלית עם פתרונות מלאים. מתאים למי שרוצה לאמן מודל שיחה על תכנות בלי לגרד קוד גולמי מהרשת.

  • 1,692הורדות בחודש
  • 67לייקים

מה זה

המאגר כולל 27 אלף רשומות המכסות מגוון נושאים בפייתון, מתחביר בסיסי ומבני נתונים ועד אלגוריתמים, שאילתות מסדי נתונים ולמידת מכונה. כל רשומה מובנית כשיחה בעלת שני תורות, שבה המשתמש מבקש לכתוב תוכנית או לפתור בעיה, והבוט מחזיר קוד עם תיעוד והסבר.

התוכן נוצר כולו באופן סינתטי. היוצרים אספו נושאי לימוד כזרעים ראשוניים, שיבצו אותם בתבניות הנחיה, וליטשו את הניסוחים באמצעות מסגרת העבודה קאמל לקבלת גיוון. את ההנחיות המלוטשות הזינו למודל מורה שיצר את השאלות, ולאחר מכן הפיק גם את הפתרונות. בסיום התהליך בוצע שלב של איחוד והסרת כפילויות.

מתאים ל

  • אימון הוראות למודלי קוד

    כוונון עדין למודלי שפה קטנים כדי שילמדו לענות לשאלות תכנות ולייצר פונקציות מתועדות בפייתון.

  • בדיקת יכולות סינתטיות

    הערכת היכולת של מודלי שפה להתמודד עם פתרון בעיות קלאסיות ואלגוריתמיקה מתוך הנחיות טקסטואליות.

  • סינון וטיוב נתונים

    בסיס גולמי לסינון על ידי מריצי קוד חיצוניים כדי לבנות דאטהסט נקי ואיכותי יותר לשימוש מחקרי.

איפה זה נופל

היוצרים מודים בפירוש שהנתונים לא עברו בדיקה ידנית או אימות קפדני. בגלל שהכל יוצר על ידי מודל שפה, יש סיכוי ממשי לשגיאות לוגיות בקוד, הסברים מטעים וכפילויות סמנטיות שלא נתפסו בניקוי. הטקסט כולו באנגלית בלבד וללא עברית. מי שרוצה להשתמש בחומר הזה לאימון מודל קוד חייב להריץ בדיקות תחביר ולהריץ את הקוד בסביבה מבודדת לפני שמכניסים אותו למערך אימון רציני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המוגדר הוא cc-by-nc-sa-4.0 שאוסר שימוש מסחרי באופן מפורש. כל מודל שיאומן עליו יהיה מוגבל למחקר בלבד ויחייב שיתוף תחת אותו רישיון. לחברות שמחפשות דאטה לאימון מוצרים אסור לגעת בו.

האם יש במאגר תוכן בעברית?

אין במאגר עברית בכלל, כל 27 אלף התרגילים והפתרונות נכתבו באנגלית בלבד. אם המטרה היא לאמן מודל שמבין הנחיות בעברית, תצטרכו לתרגם את השאלות בעצמכם. שפת הקוד עצמה היא פייתון תקנית.

איך הנתונים נאספו ונבדקו?

הנתונים לא נאספו ממאגרי קוד אמיתיים אלא יוצרו מאפס בעזרת מודל מורה ומסגרת קאמל. תהליך הסינון כלל הסרת כפילויות בלבד, ללא בדיקה ידנית של איכות התוכן. היוצרים מציינים בעצמם שייתכנו שגיאות קוד ובעיות לוגיות בתשובות.

במה הדאטהסט הזה שונה מאוספי קוד מגיטהאב?

הוא בנוי כהוראות ופתרונות ממוקדים ולא כקבצי קוד גולמיים מתוך פרויקטים. המבנה של שאלת תכנות ותשובה מתועדת חוסך את הצורך לנקות קבצים ארוכים ולהמציא להם משימות. מצד שני, קוד סינתטי סובל לפעמים מחוסר מגוון ומשגיאות שמודלים מייצרים.

איך טוענים

הנתונים מגיעים בקובץ יחיד בשם CodeExercise-Python-27k.json שפתוח להורדה ישירה ללא צורך בהרשאות מיוחדות. המבנה הוא אובייקט עם מזהה, שם המאגר, ומערך שיחה של שתי הודעות. כשמעבדים את הקובץ לאימון, צריך לשלוף את התוכן של שתי ההודעות מתוך המערך ולהמיר אותם לפורמט הפרומפט של המודל שלכם.

from datasets import load_dataset

ds = load_dataset("codefuse-ai/CodeExercise-Python-27k")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי, חובת מתן קרדיט ליוצרים, ודרישה לשתף כל יצירה נגזרת תחת אותו הרישיון בדיוק. מודל שתאמנו על הנתונים האלה לא יוכל לשמש מוצר מסחרי, וכל שחרור של משקולות ידרוש כבילה לאותם תנאים מגבילים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗