GPT
S

stack-v3-train

קוד פתוח

HuggingFaceCodeodc-by2026-07-23

  • code

מאגר קוד פתוח עצום מגיטהאב ששומר את תוכן הקבצים בתוכו ומאורגן לפי ריפוזיטורי שלם. הוא מיועד למי שרוצה לאמן מודלי שפה על הקשר מלא של פרויקטים בלי להוריד קבצים בנפרד.

  • 217,800הורדות בחודש
  • 377לייקים

מה זה

הרשומות במאגר מייצגות ריפוזיטוריז שלמים ולא קבצים בודדים. כל שורה מכילה מזהה גיטהאב, נתוני קומיט אחרון, מדדים כמו כוכבים ופיצולים, ומערך של קבצים עם טקסט המקור שלהם לאחר פענוח וניקוי. המקורות נאספו מסריקה ישירה של גיטהאב באוגוסט 2025, על בסיס רשימות ממאגר האירועים של GH Archive וגרף המקורות של Software Heritage. נכללו רק ריפוזיטוריז ציבוריים, וענפי ברירת המחדל שלהם בלבד ללא היסטוריית גרסאות.

תהליך הסינון הוריד קבצים בינאריים, קבצים מעל חמישה מגה בייט וריפוזיטוריז עם מעל מיליון קבצים. נעשה זיהוי שפות באמצעות go-enry ובדיקת רישיונות בעזרת ScanCode, כאשר קוד שסווג כבעל רישיון מגביל הוסר לחלוטין. בנוסף הופעל ניקוי כפילויות מבוסס MinHash חוצה שפות, הוסרו נתונים אישיים ומפתחות באמצעות מודל ייעודי, ומחברות Jupyter נוקו מפלט ותמונות ונשמרו כמבנה JSON.

מתאים ל

  • אימון מקדים למודלי קוד

    בניית מודלי שפה שמבינים הקשר של תיקייה שלמה וקשרים בין קבצים בפרויקט.

  • הערכת ביצועי מודלים

    מדידת יכולת ייצור והשלמת קוד לפי שפות תכנות ודפוסי ארכיטקטורה עדכניים.

  • ניתוח סטטיסטי של קוד פתוח

    מחקר על דפוסי כתיבה, רישיונות ושימוש בשפות שונות בפרויקטים מגיטהאב.

איפה זה נופל

הנתונים מוטים חזק לשפות פופולריות כמו פייתון, ג'אווהסקריפט ו־C, ולטקסט באנגלית בהערות ובתיעוד, כך שאין כאן כמעט עברית או ייצוג לשפות תכנות נידחות. המאגר מוגבל לנקודת זמן אחת מאוגוסט 2025, ללא ענפים צדדיים או היסטוריית קומיטים שמלמדת איך קוד נבנה. סריקת הרישיונות וזיהוי המידע האישי אינם מושלמים, וייתכן שדלפו פנימה קוד זדוני או מפתחות שלא זוהו. הוא גם לא כולל תיעוד נלווה כמו דיונים, פול ריקווסטים או עמודי וויקיפדיה שהיו חלק מגרסאות עבר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

הרישיון של המאגר מתיר שימוש מסחרי עם מתן קרדיט מתאים. יחד עם זאת, הקבצים עצמם נאספו מריפוזיטוריז שונים וכוללים רישיונות מקוריים משלהם, בעיקר רישיונות מתירניים. יש לעיין במטא-דאטה של כל קובץ כדי לוודא עמידה בדרישות הייחוס של אותם רישיונות.

כמה נפח אחסון נדרש כדי להוריד את המאגר?

גרסת האימון הזו שוקלת 15.9 טרה בייט ומכילה מעל 8,000 קובצי Parquet. הורדה מקומית מלאה דורשת שטח אחסון נרחב ותשתית מתאימה. לעבודה מהירה או לבדיקות מומלץ להזרים את הנתונים ישירות בלי להוריד את כל הנפח.

האם המאגר כולל טקסט וקוד בעברית?

המאגר ממוקד בקוד מקור, ושפת התיעוד וההערות ברובה המכריע היא אנגלית. טקסט בעברית עשוי להופיע באופן מקרי בלבד בהערות או במחרוזות מתוך ריפוזיטוריז של מפתחים ישראלים, אך אין סינון או תמיכה ייעודית לשפות שאינן אנגלית.

מה ההבדל העיקרי בין המאגר הזה לגרסאות קודמות של The Stack?

גרסה זו כוללת את תוכן הקבצים ישירות בתוך השורות במקום להפנות למזהים חיצוניים שדורשים הורדה נוספת. בנוסף, הנתונים מקורם בסריקה ישירה מגיטהאב שמשקפת את מצב הקוד באוגוסט 2025, וכל רשומה מייצגת פרויקט שלם ולא קובץ בודד.

איך טוענים

טוענים את המאגר באמצעות ספריית datasets עם נתיב היעד, או בקריאה ישירה לקובצי Parquet באמצעות DuckDB ופולארס. המאגר פתוח לציבור ללא צורך באישור גישה מראש. תת המאגר לאימון תופס 15.9 טרה בייט ומחולק לאלפי קבצי Parquet דחוסים, כך שחובה לעבוד בסטרימינג לצורך בדיקות או להכין תשתית אחסון מתאימה להורדה מלאה. השדות החשובים לטעינה הם files המכיל את התוכן והשפה, repo_path ונתוני הרישיון המסווגים לכל קובץ.

from datasets import load_dataset

ds = load_dataset("HuggingFaceCode/stack-v3-train")

הרישיון

המאגר עצמו מופץ ברישיון odc-by, שמתיר שימוש מסחרי, שינוי ושיתוף בכפוף למתן קרדיט. הקוד שבפנים נאסף מפרויקטים עם רישיונות שונים שהוגדרו מתירניים או ללא רישיון מזוהה. שימוש בקוד מחייב עמידה בתנאי הרישיון המקורי של כל קובץ, כולל ייחוס למחברים לפי המטא-דאטה המצורף. הרישיון לא כופה שיתוף מודלים באותו רישיון, אך יש לוודא שהשימוש בתוצרי האימון תואם את רישיונות המקור שמהם נלמד הקוד.

הרישיון המלא ב־Hugging Face ↗