GPT
S

stack-edu

קוד פתוח

HuggingFaceTBרישיון לא דווח2025-03-18

המאגר מרכז 125 מיליארד טוקנים של קוד שנבחרו מתוך The Stack v2 בגלל ערך לימודי גבוה. הוא נועד לאימון מודלי שפה שצריכים לכתוב קוד איכותי בלי רעשי רקע מיותרים.

  • 5,121הורדות בחודש
  • 78לייקים

מה זה

הנתונים נלקחו מתוך StarCoder2Data וכוללים 15 שפות תכנות מובילות, כמו ג'אווה, פייתון, Cpp, מרקדאון, SQL ו־JavaScript. כדי לסנן את החומר, החוקרים אימנו מודלי סיווג ייעודיים לכל שפה בעזרת StarEncoder ותיוגים שנוצרו על ידי Llama3-70B-Instruct. הסינון השאיר רק קבצים שקיבלו ציון חינוכי של 3 ומעלה מתוך 5, למעט ג'אווה שבה הסתפקו בסף 2.

המבנה במאגר מחולק לתיקיות לפי שפות תכנות בקבצי parquet, כאשר יש 44 קבצים בסך הכל. ג'אווה תופסת את הנפח הגדול ביותר עם 42.1 מיליארד טוקנים, פייתון אחריה עם 21.8 מיליארד, ו־Ruby סוגרת את הרשימה עם 1.61 מיליארד טוקנים בלבד.

מתאים ל

  • אימון מודלי קוד

    אימון מקדים או המשך אימון של מודלי שפה על קוד שנבחר לפי איכות לימודית.

  • בניית כלי השלמת קוד

    שיפור יכולות יצירת קוד ב־15 שפות הפיתוח שנכללות בערכה.

  • מחקר על איכות דאטה

    בדיקת השפעת סינון חינוכי של קוד על ביצועי מודלים במבחני MultiPL-E.

איפה זה נופל

הבעיה המרכזית היא שאין כאן קוד מוכן לעבודה מיידית, אלא רק מזהים שדורשים תשתית הורדה נפרדת וזמן ריצה ארוך. בנוסף, הכיסוי מוגבל ל־15 שפות בלבד, כאשר יש פערים עצומים ביניהן, מ־42 מיליארד טוקנים בג'אווה ועד פחות מ־2 מיליארד ברובי, גו או ראסט. שפות תכנות אחרות חסרות לגמרי, והסינון נשען על מודלים שתוייגו בנתונים סינתטיים, מה שיכול להכניס הטיות של מודל המקור.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מסחרי?

הרישיון של המאגר עצמו לא דווח בעמוד. היוצרים מפנים לבדיקת הרישיונות של the-stack-v2 כדי להבין מה מותר ומה אסור. במצב כזה, חברות צריכות לברר את המקורות המשפטיים לפני שילוב הנתונים במוצר מסחרי.

איך מורידים את תוכן הקבצים למחשב?

המאגר כולל רק מזהי SWHID ולא את קבצי הקוד עצמם. את התוכן מושכים ישירות מבאקט S3 של Software Heritage באמצעות סקריפט מתאים. מפתח המאגר מציין שהורדה כזו אורכת כ־6 שעות על שרת של 16 ליבות ב־AWS.

האם המאגר כולל טקסט בעברית?

הנתונים מורכבים מקוד תוכנה בלבד מתוך 15 שפות פיתוח ספציפיות. ייתכן שיש עברית בהערות קוד או בקבצי מרקדאון, אבל המאגר לא נבנה או סונן לפי שפות אנושיות. מי שמחפש טקסט עברי לא ימצא כאן מענה מכוון.

במה המאגר שונה מגרסאות קודמות של The Stack?

במקום לשמור את כל הקוד הגולמי, כאן הופעל מסנן מבוסס בינה מלאכותית בהשראת FineWeb-Edu. המודלים דירגו את הקבצים וסיננו החוצה כל מה שלא הגיע לרף איכות לימודי. התוצאה היא 125 מיליארד טוקנים נקיים יותר שמציגים שיפור במבחני MultiPL-E.

איך טוענים

טעינת המאגר לא נותנת לכם את הקוד עצמו מיד. הקבצים מכילים מזהי SWHID בלבד, כך שאת תוכן הקבצים בפועל צריך למשוך מבאקט S3 של Software Heritage. לפי הכרטיס, תהליך ההורדה לוקח בערך 6 שעות על שרת AWS עם 16 ליבות באזור us-east-1. החלוקה נעשית לפי שפות ספציפיות כמו C, CSharp או Cpp בקבצי parquet נפרדים.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/stack-edu")

הרישיון

הרישיון של המאגר הזה לא דווח בכרטיס. היוצרים מפנים לבדיקת תנאי הרישוי של the-stack-v2 כדי להבין את המצב המשפטי. בפועל, כל עוד אין רישיון ברור שמוצמד לקבצים, יש סיכון משפטי באימון מודלים מסחריים וצריך לבדוק לעומק את המקורות ב־Software Heritage לפני השימוש.

הרישיון המלא ב־Hugging Face ↗