GPT
D

developer-productivity-simulated-behavioral-data

קוד פתוח

strova-aiapache-2.02025-08-22

נתונים סינתטיים שמדמים שגרת יום של מפתחים, כולל שעות שינה, צריכת קפאין ועבודה עם כלי בינה מלאכותית. זה מתאים למי שבונה מודל לחיזוי עומס או הצלחה במשימות בלי להסתבך עם פגיעה בפרטיות עובדים.

  • 65הורדות בחודש
  • 503לייקים

מה זה

מדובר במאגר טבלאי קטן שמכיל 500 רשומות יומיות סינתטיות. כל שורה מייצגת יום עבודה יחיד של מפתח, עם שדות מספריים פשוטים כמו שעות קידוד בפועל, כמות הפרעות מפגישות או מסלאק, שעות שינה בלילה הקודם, מספר קומיטים ובאגים שדווחו. המשתנה המרכזי לחיזוי הוא הצלחה בביצוע המשימה היומית כערך בינארי של אפס או אחד.

הנתונים לא הגיעו ממפתחים אמיתיים ולא נמדדו בשטח. היוצרים יצרו אותם באופן מלאכותי לחלוטין על בסיס הנחות עבודה, היוריסטיקות ומגמות מוכרות בתעשיית התוכנה לגבי הקשר בין שינה, לחץ ותפוקה. אין כאן חלוקה מובנית לסט אימון ובדיקה, והקובץ כולו יושב בטבלה אחת שממנה צריך לגזור את החלוקה בעצמכם.

מתאים ל

  • סיווג בינארי בסיסי

    חיזוי עמידה ביעד היומי לפי כמות שינה, עומס קוגניטיבי והפרעות.

  • ניתוח אשכולות מפתחים

    חלוקת דפוסי עבודה לקבוצות כמו מפתחים עם צריכת קפאין גבוהה ומעט באגים.

  • הערכת עומס קוגניטיבי

    בניית מודל רגרסיה שמעריך את רמת הלחץ לפי שעות קידוד ושימוש בבינה מלאכותית.

איפה זה נופל

זהו מאגר סינתטי של 500 שורות בלבד, כך שלא הייתי משתמש בו לשום דבר שמתקרב למוצר אמיתי. הנתונים מייצגים הנחות מוקדמות של מי שייצר אותם ולא התנהגות אנושית מורכבת. אם המודל לומד שיותר קפה שווה פחות באגים, זה רק כי מישהו הגדיר את הנוסחה הזו מראש. בנוסף אין כאן ממד זמן אמיתי או היסטוריה עקבית של עובד ספציפי, ואין שום התייחסות לשפות או לטקסט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

כן, רישיון Apache 2.0 מאפשר שימוש מסחרי חופשי, כולל אימון מודלים שנמכרים ללקוחות. נדרש רק לשמור על הקרדיט והצהרת הרישיון המקורית בקוד שלכם.

כמה שוקל הדאטהסט והאם נדרש מחשב חזק?

הדאטהסט מכיל 500 שורות בלבד בקובץ CSV אחד, וגודלו זניח לחלוטין, פחות מכמה עשרות קילובייטים. כל מחשב נייד בסיסי יכול לטעון ולעבד אותו באופן מיידי.

האם המאגר כולל נתונים בעברית או טקסט חופשי?

לא, אין במאגר טקסט כלל. מדובר בתשע עמודות נומריות בלבד שמייצגות מדדים כמו שעות, כמויות וציונים בסקאלה של 1 עד 10.

איך נאספו הנתונים האלה?

הנתונים לא נאספו מעובדים או ממערכות אמיתיות, אלא נוצרו באופן סינתטי מלא על ידי strova-ai. הם מסתמכים על היוריסטיקות ומחקרים תאורטיים לגבי הרגלי עבודה ופריון של מתכנתים.

איך טוענים

הקובץ המרכזי מגיע בפורמט CSV סטנדרטי תחת השם Developer_Productivity_Synthetic_Syncora.csv לצד מחברת ג׳ופיטר לניתוח ראשוני. אין צורך בבקשת גישה מיוחדת או באימות, אפשר להוריד ישירות דרך פנדס או הספרייה של האגינג פייס. הנתונים מורכבים מתשעה שדות נומריים בלבד, ללא טקסט חופשי, כך שטעינה ועיבוד ראשוני ייקחו פחות משנייה על כל מחשב בסיסי.

from datasets import load_dataset

ds = load_dataset("strova-ai/developer-productivity-simulated-behavioral-data")

הרישיון

המאגר מופץ ברישיון Apache 2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של המידע ואימון מודלים ללא דרישה לחשוף את הקוד שלכם או לשתף את התוצרים באותו רישיון. החובה היחידה היא לשמור על הודעת זכויות היוצרים ועותק הרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗