GPT
R

rStar-Coder

קוד פתוח

microsoftcc-by-4.02025-06-11

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המאגר כולל בעיות תכנות תחרותיות, פתרונות עם שרשרת חשיבה ארוכה ובדיקות תוכנה. הוא מיועד למי שרוצה לאמן מודלים על חשיבה תכנותית מעמיקה ולא רק על יצירת קוד בסיסי.

  • 53,828הורדות בחודש
  • 246לייקים

מה זה

הנתונים מורכבים משני מקורות עיקריים: בעיות מקור מתחרויות תכנות ובעיות שנוצרו באופן סינתטי על בסיסן. הרשומות כוללות תיאורי בעיות, קוד התחלתי, פתרונות מפורטים הכוללים הסבר ארוך, את הקוד עצמו ומערכי בדיקות לאימות התוצאות.

המאגר מחולק לחמישה חלקים שונים שמתאימים לשלבים שונים באימון. תמצאו כאן חלקים ייעודיים ללימוד מונחה, הכוללים בעיות מקור ובעיות סינתטיות עם סימוני אימות ובדיקות שעברו בהצלחה, לצד חלקים שמיועדים ללמידת חיזוק ומכילים שאלות ומערכי בדיקה נפרדים המקושרים באמצעות מזהה ייחודי.

בדיקות התוכנה עצמן מגיעות בפורמטים מגוונים של קלט ופלט סטנדרטיים, מילוני פרמטרים או פקודות בדיקה ישירות. בחלק מבעיות המקור מופיע גם סימון שמבדיל בין בדיקה רשמית של התחרות לבין בדיקה שנוצרה באופן סינתטי כדי להרחיב את הכיסוי.

מתאים ל

  • אימון מונחה לחשיבה בקוד

    שימוש בפתרונות המפורטים עם שרשרת החשיבה כדי ללמד מודלים לפתור בעיות מורכבות שלב אחר שלב.

  • למידת חיזוק לתכנות

    הרצת בדיקות התוכנה המצורפות מול קוד שהמודל מייצר כדי להעניק תגמול מדויק לפי הצלחה.

  • הרחבת מאגרי בעיות

    הסתמכות על הקשרים בין בעיות המקור לבעיות הסינתטיות כדי לחקור שיטות ליצירת נתוני אימון חדשים.

איפה זה נופל

הנפח הוא המכשול הראשון שתפגשו, שכן כל החלקים יחד שוקלים מעל 480 גיגה בייט ודורשים ניהול זיכרון קפדני בזמן העיבוד. מעבר לכך, המאגר מתמקד כולו בבעיות תכנות תחרותיות באנגלית, כך שהוא לא מלמד פיתוח מערכות אמיתיות, ארכיטקטורה או עבודה עם שפות שאינן אנגלית.

בנוסף, חלק מעמודי הבדיקות דורשים ניתוח ופירוק ידני של הקלט והפלט לפני שאפשר להריץ אותם בסביבת בדיקה. אם אתם בונים מודל לתעשייה, קחו בחשבון שחלק מהשאלות והבדיקות נוצרו בצורה סינתטית ויכולות להכיל הטיות או כשלים לוגיים שלא מופיעים בבעיות שנכתבו בידי אדם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. הרישיון הוא CC BY 4.0 והוא מתיר שימוש מסחרי מלא, כל עוד אתם מייחסים את העבודה ליוצרים לפי ההנחיות בציטוט.

כמה שטח אחסון צריך בשביל להוריד אותו?

כל חלקי המאגר יחד שוקלים מעל 480 גיגה בייט. אם אין לכם מספיק מקום, כדאי להוריד רק את החלק שאתם צריכים או להשתמש בטעינה בהזרמה.

האם יש במאגר בעיות או פתרונות בעברית?

לא. כל הנתונים מבוססים על בעיות תכנות תחרותיות שנאספו ונוצרו באנגלית בלבד, ואין שם תוכן מקומי.

איך נאספו הנתונים?

הבסיס מגיע מפלטפורמות של תחרויות תכנות שסיפקו את שאלות המקור והקוד ההתחלתי. משם החוקרים ייצרו בעיות סינתטיות נוספות, פתרונות עם שרשרת חשיבה ארוכה ובדיקות תוכנה לאימות.

איך טוענים

טוענים אותו ישירות דרך ספריית datasets באמצעות פקודת load_dataset בציון החלק המבוקש, או מורידים מקומית דרך הטרמינל. בגלל המשקל הכבד מומלץ להשתמש באפשרות ההזרמה אם רוצים רק לדגום נתונים. אין צורך באישור גישה מיוחד, אך חובה לשים לב לשדות הקלט והפלט בחלקי הבדיקות שמחייבים פענוח לפני השימוש.

from datasets import load_dataset

ds = load_dataset("microsoft/rStar-Coder")

הרישיון

הרישיון הוא CC BY 4.0, מה שאומר שמותר להשתמש במידע באופן חופשי, כולל למטרות מסחריות, שינוי והפצה. התנאי היחיד הוא מתן קרדיט מתאים לחוקרים ממיקרוסופט שפרסמו את העבודה. אין כאן דרישה לשתף את המודל המאומן באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗