GPT
S

salaries

קוד פתוח

datapizza-ai-labcc-by-nc-4.02025-12-05

  • salaries
  • italy
  • tech
  • survey
  • compensation

נתוני שכר וסקר מקצועי של עובדי הייטק באיטליה שמתעדכנים מדי שבוע. החומר כולל דיווחי שכר ברוטו ביורו לצד הרגלי שימוש בכלי בינה מלאכותית ומאפייני מעסיקים.

  • 256הורדות בחודש
  • 81לייקים

מה זה

המאגר כולל עשרות אלפי רשומות שמבוססות על סקר אנונימי מקוון בקרב אנשי טכנולוגיה באיטליה. הנתונים מתעדכנים באופן שבועי ומציגים תמונת מצב מפורטת על עובדים בשוק האיטלקי, החל מתפקידים כמו מפתחי תוכנה ומדעני נתונים, דרך שנות ניסיון וגודל חברה, ועד מחוז המגורים ומודל העבודה בפועל.

חלק מהותי מהמידע מתמקד בסביבת הפיתוח ובכלי עבודה יומיומיים. הרשומות מפרטות את סביבות הפיתוח המועדפות, טכנולוגיות מרכזיות, וכן פרטים ייחודיים על אימוץ בינה מלאכותית: תדירות השימוש, כלים ספציפיים כמו קלוד, קופיילוט או צ'אט ג'יפיטי, סוגי המשימות ומקורות המידע שמהם העובדים לומדים על חידושים בתחום.

מתאים ל

  • מחקר על פערי שכר

    ניתוח התפלגות השכר בהייטק האיטלקי לפי שנות ניסיון, מגדר והשכלה לצורכי מחקר אקדמי.

  • בדיקת אימוץ כלי קוד

    מיפוי הרגלי העבודה של מתכנתים סביב עורכי קוד וכלי סיוע מבוססי מודלי שפה באירופה.

  • אימון מודלי חיזוי שכר

    בניית מודלים סטטיסטיים להערכת שווי שוק לפי מחוז מגורים וטכנולוגיות במסגרת פרויקט פנימי.

איפה זה נופל

כל הנתונים מבוססים על דיווח עצמי בסקר אינטרנטי אנונימי, כך שאין שום אימות חיצוני מול תלושי שכר או נתוני מס אמיתיים. הדיווחים שהוגשו לפני 6 בנובמבר 2024 חלקיים מאוד, ואינם מכילים שדות מרכזיים שנכנסו רק בגרסה המאוחרת של השאלון, מה שמחייב סינון של היסטוריית הרישום.

בנוסף, הנתונים רלוונטיים לחלוטין לשוק האיטלקי בלבד, שבו רמות השכר, המיסוי ותרבות התעסוקה שונות לחלוטין ממה שמקובל בישראל או בארצות הברית. שמות התעשיות מופיעים באיטלקית, ואין בדאטה שום ייצוג לעובדים מקומיים מישראל או לנתונים בשפה העברית.

שאלות
נפוצות

האם מותר להשתמש בנתונים האלה במוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0 שמגביל את השימוש למטרות לא מסחריות בלבד. אם המטרה היא אימון מודל שיוטמע באפליקציה בתשלום או כחלק משירות עסקי, הרישיון הזה פוסל את השימוש.

האם הדאטהסט כולל נתונים על השוק הישראלי או עברית?

לא, אין בו שום ייצוג לשוק הישראלי או לעברית. הסקר מתמקד כולו בעובדי טכנולוגיה באיטליה, השכר מדווח ביורו לפי מחוזות איטלקיים, וסיווגי התעשיות כתובים באיטלקית.

איך הנתונים נאספו והאם הם מאומתים?

המידע נאסף דרך שאלון אינטרנטי פתוח ואנונימי שמפעיל אתר ייעודי בשם Datapizza. הנתונים מבוססים על דיווח עצמי בלבד של העונים, ללא בדיקת תלושי שכר, אם כי קיים שדה בוליאני בשם valid שמסמן דיווחים שעברו בדיקת תקינות בסיסית של המערכת שלהם.

מדוע חלק מהרשומות ריקות משדות כמו גיל ושימוש בבינה מלאכותית?

הגרסה הראשונה של השאלון לא כללה את השדות האלה כלל. רק דיווחים שנרשמו החל מ־6 בנובמבר 2024 ואילך כוללים שדות כמו גיל, השכלה, תדירות שימוש בכלי בינה מלאכותית והעדפות סביבת פיתוח, ולכן יש לבצע סינון לפי תאריך ההגשה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון בעזרת קריאת load_dataset למזהה datapizza-ai-lab/salaries, ללא צורך באישור גישה מוקדם או בהרשמה מיוחדת. הקובץ המרכזי שמכיל את התשובות שמור בפורמט jsonl בתוך המאגר, וכולל בין עשרות אלפים למאה אלף רשומות, כך שהוא נטען מהר מאוד ולא דורש זיכרון עבודה חריג.

לפני שמתחילים לנתח או לאמן, יש לשים לב לשדה valid שמסמן אילו דיווחים עברו בדיקת תקינות. בנוסף, חובה לבדוק את חותמת הזמן submittedAt, כיוון שדיווחים ישנים יותר מנובמבר 2024 חסרים משתנים מהותיים כמו השכלה, גיל ונתוני שימוש בבינה מלאכותית.

from datasets import load_dataset

ds = load_dataset("datapizza-ai-lab/salaries")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. הרישיון מאפשר לשתף, להעתיק ולעבד את הנתונים, אך ורק למטרות שאינן מסחריות ותוך מתן קרדיט מלא ליוצרים. אסור להשתמש במידע כדי לבנות מודל מסחרי, לשלב אותו בתוך מוצר שנמכר ללקוחות או לייצר ממנו רווח כספי כלשהו.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗