GPT
D

data_jobs

קוד פתוח

lukebarousseapache-2.02024-03-21

מודעות דרושים אמיתיות בתחומי הדאטה משנת 2023, כולל שכר, כישורים וסיווגי תפקידים. זה מעניין בעיקר למי שבונה מודלים סביב שוק התעסוקה הטכנולוגי ומחפש טקסטים גולמיים לצד שדות מובנים.

  • 11,256הורדות בחודש
  • 94לייקים

מה זה

המאגר מורכב ממודעות דרושים שנאספו במהלך שנת 2023 דרך גוגל בעזרת בוט ושימוש ב־SerpApi. כל רשומה מייצגת מודעת עבודה שפורסמה במקור בפלטפורמות שונות כמו לינקדאין וג'וביג'ובה, ומכילה פרטים גולמיים לצד נתונים מעובדים. הרשומות כוללות את כותרת המשרה המקורית, שם החברה, מיקום המשרה, תאריך הפרסום, היקף המשרה והאם העבודה היא מרחוק.

חלק מהמידע עבר עיבוד מוקדם. כותרות המשרות תוקננו לעשר קטגוריות באמצעות מודל BERT, ורשימות הכישורים הטכנולוגיים חולצו מהטקסט בעזרת PySpark ומופו לפי תחומים כמו ענן או ספריות קוד. בנוסף, חושבו ממוצעי שכר שנתיים ושעתיים מתוך טווחי שכר שהופיעו במודעות, וחולצו מאפיינים בוליאניים כמו דרישה לתואר וביטוח בריאות.

מתאים ל

  • ניתוח דרישות שכר

    מיפוי השכר הממוצע לפי כותרת משרה, היקף משרה או עבודה מרחוק עבור תפקידי דאטה שונים.

  • חילוץ כישורים מבוקשים

    בניית מודלים שמזהים ומסווגים מיומנויות וטכנולוגיות מתוך תיאורי משרות טכנולוגיות.

  • סיווג כותרות משרות

    אימון ובדיקה של מודלי שפה לסיווג טקסט חופשי של משרות לקטגוריות תקניות בתעשייה.

איפה זה נופל

הנתונים משקפים רק את שנת 2023 ונאספו רק דרך תוצאות חיפוש של גוגל, מה שיוצר הטיה מובנית לכיוון פלטפורמות ומשרות שגוגל מקדם. שדות השכר מבוססים אך ורק על מה שהמעסיק ציין בטקסט המודעה, ולכן בחלק ניכר מהמשרות השכר פשוט ריק. הסיווג של עשרת התפקידים בוצע על ידי מודל BERT חיצוני ועלול להכיל טעויות סיווג שלא נבדקו ידנית. כמו כן, חילוץ הכישורים הוגבל למונחים שהוגדרו מראש בעיבוד, והכרטיס אינו מפרט תמיכה בשפות שאינן אנגלית.

שאלות
נפוצות

האם מותר להשתמש במידע במוצר מסחרי?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי, הפצה ושינוי של הנתונים ללא תשלום. החובה היחידה היא לכלול את עותק הרישיון ולתת קרדיט ליוצר המקורי.

האם יש במאגר מודעות בעברית או מישראל?

האיסוף נעשה דרך מונחי חיפוש רחבים בגוגל ויש שדה לזיהוי מדינה, כך שייתכן שיש משרות שפורסמו בישראל. עם זאת, המאגר ממוקד באנגלית והחילוץ האוטומטי של הכישורים והכותרות מותאם לשפה זו בלבד.

מאיפה הנתונים הגיעו במקור?

המידע נאסף לאורך 2023 באמצעות בוט שסרק מודעות דרושים מגוגל דרך SerpApi. המודעות עצמן הגיעו מאתרים כמו לינקדאין, Jobijoba ומקורות דומים שהופיעו בתוצאות החיפוש.

האם שדות השכר קיימים בכל הרשומות?

לא. שדות ממוצע השכר חושבו רק כאשר המעסיק ציין טווח שכר מפורש במודעה המקורית. ברבות מהמשרות שפורסמו הנתון הזה נעדר לחלוטין ולא הושלם בהערכה.

איך טוענים

הקובץ המרכזי שמכיל את הנתונים הוא data_jobs.csv, לצד קובץ README. לא צריך אישור גישה מיוחד כדי להוריד אותו, אפשר לטעון ישירות דרך פנדס או ספריית הדאטהסטים של הוגינג פייס. השדות שמחייבים תשומת לב הם job_skills ו־job_type_skills, שמאחסנים רשימות ומילונים כמחרוזות טקסט ודורשים המרה חזרה למבני נתונים בפייתון לפני העבודה.

from datasets import load_dataset

ds = load_dataset("lukebarousse/data_jobs")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים ושילוב שלהם בתוך מוצרים או אימון מודלים, בלי חובה לשחרר את המוצר שלכם בקוד פתוח. התנאי העיקרי הוא מתן קרדיט ליוצר המקורי ושמירה על הודעת הרישיון והזכויות בכל הפצה של הנתונים או של נגזרותיהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗