GPT
S

stackoverflow-questions

קוד פתוח

pacovaldezapache-2.02022-11-09

  • stackoverflow
  • technical questions

שאלות מסווגות מתוך סטאק אוברפלו שמיועדות לאימון מודלים לתיעדוף פניות תמיכה. החומר נדגם מתוך מעל 23 מיליון רשומות ומחולק לארבע רמות עניין ואיכות.

  • 4,867הורדות בחודש
  • 51לייקים

מה זה

המאגר מכיל מיליוני שאלות שנשלפו ישירות מהדאטהסט הציבורי של סטאק אוברפלו ב־BigQuery. כל רשומה מורכבת משלושה שדות בלבד: כותרת השאלה, גוף השאלה, ותווית מספרית בין 0 ל־3 שמייצגת את רמת החשיבות שלה.

התווית לא נקבעה ידנית אלא חושבה לפי כללים ברורים שמבוססים על צפיות, הצבעות חיוביות וסימון כמועדף. במקור היו בטבלה מעל 23 מיליון פוסטים עם הטיה עצומה לטובת שאלות חלשות שלא קיבלו יחס, אבל היוצר דגם את השורות כך שארבע המחלקות יהיו מאוזנות. החלוקה הפנימית עומדת על 40 אחוז לאימון, 40 אחוז לאימות ו־20 אחוז למבחן.

מתאים ל

  • תיעדוף טיקטים בתמיכה

    אימון מודל לזיהוי שאלות קריטיות או מורכבות על בסיס הכותרת והתוכן.

  • סיווג איכות טקסט טכני

    סינון שאלות חלשות בפורומים של מפתחים לפי דפוסי ניסוח נפוצים.

  • הערכת ביצועי מודלי שפה

    מבחן סיווג רב מחלקתי על טקסט תכנותי ארוך ומגוון באנגלית.

איפה זה נופל

כל הטקסט באנגלית בלבד, ואין פה מילה אחת בעברית. מעבר לכך, התיוג מתבסס על פופולריות היסטורית באתר ולא על הגדרה אמיתית של דחיפות או תקלות במוצר שלכם. שאלה קיבלה תווית 0 פשוט כי אלפי אנשים צפו בה, לא בהכרח כי היא מעידה על תקלה קריטית. המאגר פורסם בסוף 2022, כך שהוא לא כולל שאלות מהשנים האחרונות ועלול לפספס ספריות או פריימוורקים מודרניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא apache-2.0, שמתיר שימוש מסחרי מלא באימון מודלים ובמערכות פנימיות. צריך רק לוודא שמשאירים את הקרדיט והודעת הרישיון המקורית כנדרש.

האם יש במאגר תמיכה בעברית?

לא. כל הנתונים נמשכו מסטאק אוברפלו והשפה המוגדרת היא אנגלית בלבד. אם אתם בונים כלי לתמיכה בעברית, הנתונים האלה לא יעזרו לכם.

איך נקבעו התוויות של השאלות?

התווית חושבה בעזרת שאילתת SQL לפי כמות הצפיות, הניקוד ומספר המשתמשים ששמרו את הפוסט במועדפים. רמה 0 ניתנה לפוסטים הכי פופולריים, ורמה 3 לשאלות שקיבלו מעט מאוד עניין.

איזה מידע קיים בכל שורה?

כל שורה מכילה רק שלושה דברים: כותרת הפוסט, גוף הפוסט המלא ומספר התווית. אין כאן נתונים נוספים כמו תגיות, תאריך פרסום או התשובות שנכתבו לשאלה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באנגלית עם המזהה pacovaldez/stackoverflow-questions. הגישה חופשית לגמרי ואין צורך באישור מיוחד. המאגר יושב על 46 קובצי parquet, כולל פיצול מפורש למבחן, כך שכדאי להביא בחשבון נפח הורדה של כמה מיליוני שורות טקסט מלא לפני שמתחילים לשפוך את הכל לזיכרון.

from datasets import load_dataset

ds = load_dataset("pacovaldez/stackoverflow-questions")

הרישיון

הרישיון המדווח הוא apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים, ואינו מחייב אתכם לפתוח את הקוד שלכם או לשתף את המודל המאומן תחת אותו רישיון. החובה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗