GPT
C

churn-prediction

קוד פתוח

scikit-learncc-by-4.02022-08-08

נתוני לקוחות של חברת תקשורת פיקטיבית שנבנו במקור על ידי IBM לצורכי הדגמה. הם מתאימים בעיקר למי שבונה מודל בסיסי לחיזוי נטישה ולא רוצה להסתבך עם דאטה אמיתי ומלוכלך.

  • 3,790הורדות בחודש
  • 19לייקים

מה זה

כל שורה מייצגת לקוח בודד בחברת טלקום דמיונית, והעמודות מפרטות את המאפיינים שלו. הנתונים כוללים פרטים דמוגרפיים כמו מגדר, טווח גילאים, ומידע על בני זוג או תלויים. בנוסף יש תיעוד של השירותים שהלקוח צורך, מטלפון ואינטרנט ועד גיבוי, תמיכה טכנית ושירותי סטרימינג.

החלק החשוב לעבודה מורכב מנתוני החשבון והתשלום: ותק הלקוח בחברה, סוג החוזה, שיטת התשלום, גובה החיוב החודשי והחיוב הכולל. עמודת המטרה נקראת Churn ומסמנת מי מהלקוחות עזב בחודש האחרון. המקור מגיע מדוגמאות של IBM שהועלו בעבר לקגל, ומשם הגיעו למאגר של scikit-learn בלי פיצול מובנה מראש לרכבות בדיקה ואימון.

מתאים ל

  • תרגול חיזוי נטישה

    אימון מודלים קלאסיים של סיווג בינארי לזיהוי לקוחות בסיכון עזיבה לפי דפוסי שימוש.

  • בנצ'מרק לאלגוריתמים

    השוואת ביצועים בין מודלי עצים ורגרסיה על נתונים טבלאיים סטנדרטיים ומוכרים.

  • הדגמות והוראה

    בניית מדריכים ותרגילים לעיבוד משתנים קטגוריאליים ופיצ'ר אנג'ינירינג בלי צורך בניקוי כבד.

איפה זה נופל

זה דאטה פיקטיבי לחלוטין שנוצר להדגמות של IBM, ולכן אסור להסיק ממנו שום תובנה עסקית על לקוחות אמיתיים. הנתונים כולם באנגלית, ההקשר העסקי מייצג דפוסי שירות אמריקאיים ישנים, ואין כאן שום מידע או התאמה לשוק המקומי בישראל. אם תאמנו עליו מודל כדי להכניס אותו למוצר פעיל, אתם תגלו מהר מאוד שהתנהגות של לקוחות אמיתיים מורכבת בהרבה מהחלוקה הנקייה שמציג הקובץ הזה.

שאלות
נפוצות

האם הנתונים מייצגים לקוחות אמיתיים?

לא, התיעוד מגדיר במפורש שמדובר בחברת טלקום פיקטיבית שנוצרה כדוגמה על ידי IBM. אי אפשר להסתמך על הקשרים שנמצאים כאן עבור החלטות עסקיות בעולם האמיתי.

האם מותר להשתמש בזה למטרה מסחרית?

כן, רישיון CC BY 4.0 מאפשר שימוש מסחרי חופשי, כולל אימון מודלים. הדרישה היחידה היא לתת קרדיט למפרסמים המקוריים.

האם יש בדאטהסט תמיכה או התאמה לעברית?

אין שום נתון בעברית. שמות העמודות, הקטגוריות והערכים כולם באנגלית ומבוססים על הגדרות שירותים בארצות הברית.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

המאגר כולל קובץ dataset.csv פשוט וקובץ הסבר. אין צורך בבקשת גישה מיוחדת, וטוענים אותו ישירות כקובץ טקסט מופרד בפסיקים לתוך כל סביבת פייתון.

איך טוענים

אתם מושכים את המאגר ישירות, בלי צורך באישור גישה או הרשמה מיוחדת. הנתונים יושבים בקובץ dataset.csv פשוט לצד קובץ התיעוד, כך שכל ספריית פנדס או סקילרן תקרא אותו מיידית. שדות המפתח שתרצו לבודד הם משתנה המטרה Churn, והשדות הנומריים של ותק וחיובים לצד המשתנים הקטגוריאליים של השירותים והחוזים.

from datasets import load_dataset

ds = load_dataset("scikit-learn/churn-prediction")

הרישיון

הרישיון הוא CC BY 4.0. מותר להשתמש במידע לכל מטרה, כולל פרויקטים מסחריים, ובלבד שאתם נותנים קרדיט ראוי למקור. אין חובה לשתף את המודל או הנגזרות באותו רישיון, כך שמבחינה משפטית אתם חופשיים לאמן עליו מודלים פנימיים או מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗