GPT
S

stackoverflow-posts

קוד פתוח

mikex86other2023-06-14

  • code

המאגר מרכז כשישים מיליון פוסטים מסטאק אוברפלו שהומרו ישירות מפורמט ה־HTML המקורי למארקדאון נקי. הוא מיועד למי שרוצה לאמן מודלים על שאלות ותשובות טכניות בלי לנקות תגיות בעצמו.

  • 11,399הורדות בחודש
  • 63לייקים

מה זה

המאגר כולל את כל הפוסטים שעלו לאתר עד ה־14 ביוני 2023, והוא נבנה על בסיס דאמפ הנתונים הרשמי של סטאק אקסצ'יינג' מארכיון האינטרנט. כל רשומה מייצגת פוסט בודד, כולל שאלות, תשובות, עדכוני ויקי והצעות למנהלים. סדר הרשומות המקורי לא נשמר בגלל עיבוד מקבילי של הקבצים.

המבנה שומר על השדות המוכרים מהסכמה המקורית, בהם מזהה הפוסט, תאריכי יצירה ועריכה, ציונים, מספר צפיות, תגיות ומזהי כותבים. השדה המרכזי הוא תוכן הפוסט, שעבר המרה שיטתית בעזרת ספריית Jsoup מ־HTML למארקדאון תקני, תוך שמירה על קישורים, בלוקים של קוד, טבלאות וציטוטים לפי כללי המרה מוגדרים.

מתאים ל

  • אימון מודלי קוד

    לימוד יצירת קוד והסברים טכניים מתוך מיליוני פתרונות מתועדים.

  • מערכות מענה לשאלות

    בניית מנועי שאלות ותשובות שמחברים בין בעיות פיתוח לפתרונות מקובלים.

  • הערכת מודלים טכניים

    בדיקת יכולת המודל לבחור את התשובה הנכונה או המקובלת לשאלה נתונה.

איפה זה נופל

החומר מכיל אך ורק פוסטים באנגלית ובקוד שנכתבו עד יוני 2023, ללא מידע עדכני יותר וללא שפות אחרות. הנתונים לא סוננו לאיכות, כך שהם כוללים גם שאלות ספאם, תשובות שגויות ותוכן עם ניקוד נמוך. בנוסף, כללי ההמרה למארקדאון מנרמלים רווחים ועלולים לשבש עימוד בחלק מקטעי הקוד. החלוקה לשאלות ותשובות דורשת הצלבה עצמאית לפי מזהים כדי לקבל שיחה שלמה.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצרים מסחריים?

אין רישיון אחד שחל על הכל. המאגר שואב את הנתונים מסטאק אוברפלו, וכל פוסט כפוף לרישיון שמופיע בשדה הייעודי שלו, בדרך כלל רישיונות CC-BY-SA שדורשים ייחוס ושיתוף זהה. שימוש מסחרי מחייב בדיקה משפטית של תנאי הרישיון הספציפי לכל רשומה.

כמה מקום ומשאבים צריך כדי להוריד את המאגר?

הקבצים שוקלים כ־35 גיגה בייט בפורמט Parquet, ומכילים כ־65 מיליארד תווים בכשישים מיליון רשומות. מומלץ להשתמש ביכולת ההזרמה של הספרייה כדי לקרוא את הנתונים ישירות בלי להקצות שטח אחסון מלא מראש.

האם יש במאגר תוכן בעברית?

לא. המאגר מבוסס על האתר הראשי של סטאק אוברפלו ולכן מכיל רק טקסט באנגלית וקטעי קוד. אין בו שאלות בעברית או תמיכה מקומית.

במה הוא שונה מהדאמפ הרשמי של סטאק אקסצ'יינג'?

הדאמפ המקורי מספק את הטקסט בתוך תגיות HTML גולמיות שמקשות על אימון ישיר. כאן הטקסט כבר הומר למארקדאון נקי שנשמר בקבצי Parquet מסודרים, מה שחוסך את שלב הניקוי הראשוני.

איך טוענים

הנתונים מחולקים ל־59 קבצי Parquet בנפח כולל של כ־35 גיגה בייט. טוענים אותם ישירות דרך ספריית datasets באמצעות הנתיב mikex86/stackoverflow-posts. בגלל המשקל הכולל וכ־65 מיליארד תווים, מומלץ לעבוד עם streaming אם לא רוצים להוריד הכל מראש. שדות המפתח לעבודה הם Body שמכיל את הטקסט, PostTypeId להפרדה בין שאלות לתשובות, ו־ParentId או AcceptedAnswerId לצורך חיבור ביניהן.

from datasets import load_dataset

ds = load_dataset("mikex86/stackoverflow-posts")

הרישיון

הרישיון הכללי מסומן כ־other ולא כרישיון קוד פתוח אחיד. הסיבה היא שכל פוסט מכיל רישיון נפרד בשדה ContentLicense, שנגזר מהמועד שבו המשתמש פרסם אותו בסטאק אוברפלו, לרוב גרסאות של Creative Commons. לפני שימוש מסחרי או הפצת מודל שאומן עליו, חובה לבדוק את הרישיון ברמת הרשומה ולוודא עמידה בתנאי הייחוס והשיתוף הזהה.

הרישיון המלא ב־Hugging Face ↗