GPT
G

github-top-code

קוד פתוח

ronantakizawamit2026-02-17

  • code
  • github
  • source-code
  • trending-developers
  • software-engineering

מעל 1.3 מיליון קובצי קוד נקיים שנאספו ממאגרים של כ־4,700 המפתחים המובילים בגיטהאב. הוא חוסך סינון רעשים ומספק קוד איכותי עם מטא-דאטה עשיר.

  • 4,997הורדות בחודש
  • 125לייקים

מה זה

המאגר כולל קוד מקור בלבד שנאסף מריפוזיטוריז של מפתחים שדורגו בצמרת גיטהאב בין השנים 2015 ל־2025. כל שורה בטבלה מייצגת קובץ בודד, ללא קובצי קונפיגורציה כמו JSON או YAML וללא תיעוד כמו Markdown. האיסוף התמקד רק בפרויקטים בעלי רישיונות מתירניים כמו MIT, Apache-2.0, BSD ו־ISC.

הקוד מכסה יותר מ־80 שפות תכנות, כולל פייתון, ג'אווהסקריפט, טייפסקריפט, ראסט, גו, C/C++ וג'אווה. כל רשומה מחזיקה את תוכן הקובץ המלא יחד עם פרטים כמו נתיב, שפת הקובץ, שם הריפו, מספר הכוכבים, שפת הפרויקט ופרטי המפתח כמו שם המשתמש והחברה שבה הוא עובד.

הנתונים מחולקים לשלושה חלקים לפי מזהה הריפו כדי למנוע זליגת מידע בין קבצים מאותו פרויקט: תשעים אחוז לאימון, חמישה אחוזים לבדיקה וחמישה אחוזים לוולידציה.

מתאים ל

  • אימון מודלי השלמת קוד

    אימון מודלים גנרטיביים לכתיבת קוד על בסיס קבצים נקיים וללא קובצי קונפיגורציה.

  • בנצ'מרק להערכת מודלים

    שימוש בחלקי הבדיקה והוולידציה להערכת ביצועי מודלי קוד ללא חשש מזליגת מידע.

  • מחקר סגנונות קידוד

    ניתוח דפוסי כתיבה ומוסכמות קוד של מפתחים בכירים ביותר מ־80 שפות.

איפה זה נופל

הסינון נשען כולו על הגדרת המפתחים המובילים לפי מאגר קודם של היוצר, מה שמייצר הטיה ברורה לפרויקטים מוכרים ולסגנונות כתיבה של קבוצה מצומצמת יחסית של כ־4,700 אנשים. שפת הקובץ נקבעת אך ורק לפי סיומת הקובץ, ללא בדיקת תוכן מעמיקה. בנוסף, אין במאגר קובצי הגדרות או תיעוד, כך שהוא לא מתאים לאימון מודלים שצריכים להבין ארכיטקטורת פרויקט מלאה, סביבות ריצה או בדיקות תצורה.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן. המאגר עצמו מפורסם תחת רישיון MIT, וכל קובצי הקוד שנאספו לתוכו נלקחו מפרויקטים ברישיונות מתירניים כמו MIT, Apache-2.0 ו־BSD. אפשר לאמן עליו מודלים למוצרים מסחריים.

האם הדאטהסט כולל קוד או הערות בעברית?

המאגר מתמקד בקוד מקור באנגלית מתוך ריפוזיטוריז בינלאומיים של מפתחים בולטים. ייתכן שמופיע טקסט בעברית בהערות שוליים אקראיות, אך המאגר לא מיועד לשפה טבעית ובוודאי לא לעברית.

איך נמנעת זליגת מידע בין חלקי האימון והבדיקה?

החלוקה ל־train, test ו־validation בוצעה ברמת הריפוזיטורי באמצעות גיבוב דטרמיניסטי. כל הקבצים של פרויקט מסוים נמצאים תמיד באותו חלק, כך שהמודל לא רואה קבצים מאותו פרויקט גם באימון וגם במבחן.

במה הוא שונה ממאגרי גיטהאב כלליים כמו The Stack?

להבדיל מסריקות המוניות, כאן סוננו החוצה קובצי הגדרות ותיעוד ונשמר רק קוד מקור נקי. בנוסף, הדאטהסט מגביל את עצמו למפתחים שדורגו בצמרת האתר בין 2015 ל־2025, במקום לאסוף כל קוד ציבורי שקיים ברשת.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בפקודה load_dataset("ronantakizawa/github-top-code"). אין צורך באישור גישה מיוחד, והקבצים שמורים בפורמט Parquet המחולק ל־20 קבצי אימון ועוד קבצי בדיקה. השדות המרכזיים לעבודה ולסינון ראשוני הם file_language לשפת הקובץ, content לטקסט הקוד, ו־repo_stars אם רוצים לחתוך לפי פופולריות הפרויקט.

from datasets import load_dataset

ds = load_dataset("ronantakizawa/github-top-code")

הרישיון

המאגר מופץ ברישיון MIT, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת הרישיון וזכויות היוצרים המקוריות. הקודים שנאספו מגיעים כולם מפרויקטים בעלי רישיונות מתירניים דומים, כך שאין דרישה להפיץ תוצרים באותו רישיון, ומותר לאמן עליו מודלים מסחריים בלי לחשוף את הקוד הפנימי שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗