GPT
G

github-codereview

קוד פתוח

ronantakizawaother2026-03-03

  • code-review
  • code-generation
  • software-engineering
  • pull-requests
  • github

המאגר מרכז מעל 167 אלף שלשות של קוד לפני, הערת סקירה אנושית וקוד מתוקן, לצד דוגמאות של קוד תקין. הוא מיועד למי שרוצה לאמן מודל לתת ביקורת קוד אמיתית ולא סתם לפלוט הערות מיותרות.

  • 1,230הורדות בחודש
  • 62לייקים

מה זה

כל רשומה חיובית מייצגת הערה פנימית שכתב אדם על משיכת קוד בגיטהאב, שבעקבותיה הקוד אכן שונה. המאגר מכיל מעל 167 אלף שלשות כאלה מ־725 פרויקטים מובילים, ובנוסף מעל 51 אלף דוגמאות שליליות של קוד מאותן משיכות שלא דרש תיקון ומסומן ללא בעיות. המידע מכסה 37 שפות תכנות, כולל פייתון, טייפסקריפט, גו, ראסט וסי פלוס פלוס, כאשר לכל דוגמה מוצמד מקטע של כ־50 שורות סביב השינוי ולא הקובץ המלא.

איסוף המידע התבסס על פרויקטים פתוחים עם כוכבים רבים ורישיונות מתירניים. התהליך כלל סינון בוטים, ניקוי רעשים, הסרת טקסט שאינו באנגלית, ובדיקה שהקוד אכן תוקן לאחר ההערה. הרשומות כוללות את שמות המשתמשים, דירוג איכות, קטגוריית הערה כמו באג, שאלה או סטייל, ואת הפרש השינויים המקורי.

החלוקה קבועה מראש לפי פרויקטים, כך שכל הקוד ממאגר מסוים נמצא כולו באותו חלק. 90 אחוז מהחומר יושב בטריין, 5 אחוזים בבדיקה ו־5 אחוזים נוספים באימות.

מתאים ל

  • אימון מודל לביקורת קוד

    יצירת הערות ממוקדות על בסיס שינויי קוד וזיהוי מקרים שבהם אין צורך להעיר.

  • תיקון קוד אוטומטי

    למידת אופן יישום משוב של בודק והמרת קוד מקור לגרסה מתוקנת בהתאם להערה.

  • הערכת מודלים קיימים

    בדיקת יכולת של מודלים לזהות באגים ובעיות סגנון על פי נתוני מבחן אמיתיים.

איפה זה נופל

ההערות מוגבלות לאנגלית בלבד, ואין כאן עברית כלל. ההקשר מוגבל לכ־50 שורות סביב ההערה, כך שהמודל מפספס ארכיטקטורה רחבה יותר או תלויות בין קבצים שונים בפרויקט. למרות שבוטים סוננו, יש הסתמכות על ציון איכות אוטומטי שלא ברור בדיוק איך חושב, ויש תיוג גורף של כל קובץ שלא הוערו עליו הערות כקוד מושלם, אף על פי שבמציאות בודקים אנושיים מפספסים באגים באופן קבוע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון הכללי של הדאטהסט מוגדר כ־other ולא כרישיון קוד פתוח מוכר. המקורות עצמם נאספו ממאגרים עם רישיונות מתירניים כמו MIT ו־Apache, אך המאגר כולל גם תגובות ושמות משתמשים. אם המטרה היא מסחרית, יש סיכון משפטי ומומלץ לבדוק את התנאים לפני השימוש.

האם יש במאגר הערות בעברית?

לא. בתהליך הסינון הוסרו במפורש כל ההערות שאינן באנגלית. הקוד עצמו עשוי להכיל מחרוזות מגוונות, אך שפת הסקירה והניתוח היא אנגלית בלבד.

איך נאספו הדוגמאות השליליות שבהן אין בעיות?

בכל משיכת קוד שנסקרה, נלקחו קטעי קוד מקבצים ששונו אך לא קיבלו אף הערת סקירה. עבור קטעים אלה נקבע הטקסט No issues found, במטרה ללמד מודלים מתי לשתוק ולא לייצר הערות שווא.

במה הוא שונה ממאגרי גיטהאב רגילים של קוד?

במקום להביא רק קוד סופי או רצף קומיטים, המאגר מתמקד ברגע המדויק של המשוב האנושי. הוא מסנן מראש בוטים ומחייב שהקוד אכן השתנה בפועל בעקבות ההערה, מה שיוצר צימוד ישיר בין הביקורת לתיקון.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הנתיב ronantakizawa/github-codereview, ללא צורך באישור גישה. הקבצים שמורים בפורמט פארקט ומחולקים למספר חלקים. השדות העיקריים לעבודה הם before_code, reviewer_comment ו־after_code, לצד diff_context שמחזיק את השינוי. כדאי לשים לב לשדה is_negative שמסמן אם זו דוגמה של קוד נקי, ולשדה quality_score שמאפשר לסנן רעשים לפני האימון.

from datasets import load_dataset

ds = load_dataset("ronantakizawa/github-codereview")

הרישיון

הרישיון הרשום בעמוד המאגר מוגדר כ־other, כלומר אין רישיון אחיד ברור. היוצר מציין שהקוד נאסף ממאגרים בעלי רישיונות מתירניים כמו MIT, אפאצ'י 2.0 ו־BSD, אך שמות המשתמשים והתגובות המקוריות מגיעים מגיטהאב. מצב כזה מחייב בדיקה משפטית לפני שימוש במודל מסחרי, כי אי אפשר להסתמך על הגדרה של רישיון פתוח סטנדרטי.

הרישיון המלא ב־Hugging Face ↗