{"id":24455293,"url":"https://github.com/saob007/modelado_retencion_personal_proyecto","last_synced_at":"2026-05-16T08:36:28.550Z","repository":{"id":272853844,"uuid":"915888729","full_name":"saob007/Modelado_retencion_personal_proyecto","owner":"saob007","description":"Construcción de un modelo de aprendizaje automático que permite predecir si un empleado desertará o no de una empresa industrial de desarrollo automotriz","archived":false,"fork":false,"pushed_at":"2025-01-17T01:55:19.000Z","size":19053,"stargazers_count":1,"open_issues_count":0,"forks_count":0,"subscribers_count":1,"default_branch":"main","last_synced_at":"2025-01-27T13:21:17.226Z","etag":null,"topics":["cleaning-data","exploratory-data-analysis","exploratory-data-visualizations","jupyter-notebook","logistic-regression-classifier","pickle","python3","random","random-forest-classifier","scikitlearn-machine-learning","xgboost-classifier"],"latest_commit_sha":null,"homepage":"https://www.kaggle.com/code/saidalioviedobeltran/modelo-predictivo-retencion-proyecto","language":"Jupyter Notebook","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":null,"status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/saob007.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":null,"code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null}},"created_at":"2025-01-13T03:21:31.000Z","updated_at":"2025-01-17T21:15:04.000Z","dependencies_parsed_at":"2025-01-17T02:39:16.636Z","dependency_job_id":null,"html_url":"https://github.com/saob007/Modelado_retencion_personal_proyecto","commit_stats":null,"previous_names":["saob007/modelado_retencion_personal_proyecto"],"tags_count":0,"template":false,"template_full_name":null,"repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/saob007%2FModelado_retencion_personal_proyecto","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/saob007%2FModelado_retencion_personal_proyecto/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/saob007%2FModelado_retencion_personal_proyecto/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/saob007%2FModelado_retencion_personal_proyecto/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/saob007","download_url":"https://codeload.github.com/saob007/Modelado_retencion_personal_proyecto/tar.gz/refs/heads/main","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":243539563,"owners_count":20307356,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["cleaning-data","exploratory-data-analysis","exploratory-data-visualizations","jupyter-notebook","logistic-regression-classifier","pickle","python3","random","random-forest-classifier","scikitlearn-machine-learning","xgboost-classifier"],"created_at":"2025-01-21T02:13:03.264Z","updated_at":"2026-05-16T08:36:28.511Z","avatar_url":"https://github.com/saob007.png","language":"Jupyter Notebook","funding_links":[],"categories":[],"sub_categories":[],"readme":"# Análisis exploratorio y contrucción de un modelo predictivo de retención del talento humano, para una empresa de Desarrollo de tecnología automotriz.\n\n## Resumen\n\nEl objetivo de este proyecto fue crear varios modelos predictivos utilizando regresión logística, bosque aleatorio (Random Forest) y arboles de decisión potenciados por gradientes (XGBoost) para predecir si un trabajador renunciaría a su cargo en una empresa del sector industrial, con intención de seleccionar el modelo que mayor \"perfomance\" tenga. Este proyecto utilizó un conjunto de datos recolectados por el área de Talento Humano (RR.HH.) de la empresa, durante 10 años. El modelo ganador tuvo una rendimiento del 98,8% (accuracy), con una precisión del 98,4% (precision), una sensibilidad del 96,5% (recall), un balance del 97,4% (f1) y una discriminación del 98% (AUC) al determinar qué características eran más importantes para predecir a los empleados que dejarían la empresa de los que no. Según el modelo, la antigüedad, el nivel de satisfacción y la participación en proyectos fueron los factores más influyentes en la deserción de empleados.\n\n## Entendimiento de la problemática del negocio\n\nLos directivos de una empresa industrial, dedicada al desarrollo de tecnología automotríz, estan interesados en construir un modelo estadístico que permite predecir cuando un empleado abandona la empresa o no, a partir de algunos indicadores y datos que ha recodigo el área de Talento Humano para cada trabajador activo o retirado de la institución, con el objetivo de ejecutar acciones preventivas que minimicen la deserción del talento. Este interés surgió como respuesta a los resultados de una investigación interna que concluyó que el incremento en los costos operativos experimentados en los últimos 6 años se originaron por la necesidad de entrenamiento de nuevos empleados, perdidas materiales en el área como consecuencia de una baja adaptabilidad a los procedimientos operativos y la poca eficiencia de los procesos.\n\n## Entendimiento de los datos\n\nEl conjunto de datos aportados por la empresa industrial está comprendido por 14999 registros únicos e independientes y 10 características. Las características o variables incluyen información sobre el nivel de satisfacción comunicado por el trabajador, el nivel de desempeño calculado por el área al que pertenece, el número de proyectos en los que ha participado el trabajador, el promedio de horas mensuales trabajadas, la antigüedad del empleado, las promociones de cargo, el nivel salarial, el área o departamento al que pertenece, si ha sufrido accidentes laborales y si se el trabajador se encuentra activo o retirado de la empresa.\nEl gráfico a continuación muestra  la distribución de cuantos empleados activos y retirados existen en el conjunto de datos.\n\n\u003cp align=\"center\"\u003e\n    \u003cimg src=\"assets/img/img1.png\" alt=\"Distribución de empleados según su estado contractual\" width=\"700\"\u003e\n\u003c/p\u003e\n\nComo parte de la preparación para modelado de los datos, se eliminaron columnas innecesarias, se verificaron valores nulos y registros duplicados, se gestionaron valores atípicos y se formatearon en el tipo de datos adecuado.\n\n## Modelado y Evaluación\n\nSe seleccionó un modelo de potenciación de grádiente extremo (XGBoost) como mejor opción, compuesto por 500 árboles de decisión para determinar la importancia de las características sobre qué empleado desertaría de su cargo o no. El gráfico a continuación muestra que el tiempo en la empresa (antigüedad), el nivel de satisfacción comunicado (satisfaccion) y la cantidad de proyectos en los que ha participado (numero_proyectos) fueron los tres factores más importantes para determinar si un trabajador abandonaría la empresa. El modelo en general tuvo un rendimiento general del 98,8%, 96,5% de sensibilidad y una capacidad de discriminación del 98%, lo que quiere decir que fue capaz de discriminar y clasificar correctamente casi la totalidad de casos en el conjunto de datos de prueba, mientras identificó con alta efectividad a los empleados en riesgo de retirarse, con un 96,5% de certeza.\n\nEl gráfico de barras horizontal muestra la importancia de las características del modelo XGBoost.\n\n\u003cp align=\"center\"\u003e\n    \u003cimg src=\"assets/img/img2.png\" alt=\"Importancia de las variables\" width=\"700\"\u003e\n\u003c/p\u003e\n\n## Conclusión\n\nEste modelo puede ayudar a la empresa a mejorar la retención de talento humano, permitiendo realizar predecciones sobre qué empleados están en riesgo de abandonar la empresa, convirtiendose en una base decisiva para la elaboración de un plan de acciones preventivas mientras se abordan las causas subyacentes de la deserción del talento. \nEn escenarios fúturos de investigación se recomienda recolectar y adicionar información sobre el tipo de retiro (voluntario o causal), la posición jerárquica del cargo del empleado, la edad, la cantidad de quejas o solicitudes, la modalidad de trabajo y la jornada laboral. Estos datos adicionales podrían generar un mayor entendimiento de la dinámica de deserción.\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fsaob007%2Fmodelado_retencion_personal_proyecto","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fsaob007%2Fmodelado_retencion_personal_proyecto","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fsaob007%2Fmodelado_retencion_personal_proyecto/lists"}