Análisis estadístico de los accidentes ciclistas en España mediante el modelo de serie temporal jerárquica agrupada
Le résumé fourni par la source
Los accidentes de trafico con victimas ciclistas son uno de los problemas viales mas importantes del momento en Espana y un tema muy actual en las noticias. Por ello, este proyecto se centra en estudiar, mediante el programa estadistico R, como ha evolucionado el numero de victimas de estos vehiculos desde 1999 hasta 2017 y que factores intervienen en esta variacion. Otro de los objetivos del proyecto es establecer un modelo de prediccion para la evolucion del numero de victimas para este tipo de accidentes en los proximos cinco anos, desde 2018 hasta 2022. Los datos utilizados para llevar a cabo este analisis han sido extraidos de las tablas estadisticas anuales publicadas por la Direccion General de Trafico en su pagina web. Se tomaran las tablas desde el ano 1999 hasta 2017. El siguiente paso consiste en preparar los datos de forma que todos se encuentren en el mismo formato y hacer una seleccion de los datos de interes para el proyecto, que facilite su posterior analisis. Esta preparacion consiste en agrupar los datos en forma de variables del tipo data.frame segun los atributos que se quieren analizar. Una vez efectuada esta preparacion de los datos, estos se estudiaran mediante dos tipos de analisis llevados a cabo en RStudio: - Analisis estatico: Este primer analisis consiste en un estudio de la informacion disponible de la situacion actual de los accidentes de ciclistas en Espana. En primer lugar, mediante el paquete ggplot2 perteneciente a R, se efectua un analisis inicial representando graficamente la informacion presente en los datos de las tablas de la DGT desde 1999 hasta 2017. Aqui se podra comprobar que, efectivamente como aparece en los medios, ha habido un aumento de las victimas ciclistas y cual es la gravedad, el sexo y las franjas de edad de estas o el tipo de via en el que se comenten los accidentes: interurbana o urbana. A continuacion, se realiza un analisis de la varianza de un diseno de experimentos de tres factores. Mediante la tabla ANOVA se puede observar que factores tienen un efecto significativo en el numero de victimas y tambien los efectos de las interacciones entre ellos. Los tres factores seleccionados para el estudio de este proyecto han sido: el tipo de victima segun la gravedad del accidente (fallecido, herido grave y herido leve), el sexo de la victima (hombre o mujer) y el tipo de via en la que sucedio el accidente (interurbana o urbana). Los resultados obtenidos muestran que los tres factores son significativos, de forma que hay grandes variaciones en los grupos dentro de ellos. Asi, el grupo con mayores posibilidades de sufrir un accidente es para herido leve, hombre en via urbana. La unica interaccion entre factores cuyo efecto no es despreciable respecto al numero de victimas, es la existente entre el tipo de victima y el tipo de via. Esta interaccion se puede entender como que en vias interurbanas la gravedad de los accidentes es mayor que en el caso de vias urbanas a pesar de que el numero de victimas en interurbanas sea menor. Analisis dinamico: El objeto de este analisis es tratar la informacion como una serie temporal de datos anuales. Por la estructura de la informacion, se eligio el modelo de una serie temporal jerarquica agrupada, en la que el numero total de victimas se puede disgregar segun los grupos de los tres factores del analisis de la varianza anterior: - Tipo → Fallecido (FA), Herido Grave (HG) y Herido Leve (HL) - Sexo → Hombre (H) y Mujer (M) - Via → Interurbana (I) y Urbana (U) Estos grupos se encuentran cruzados entre ellos en distintos niveles y dan lugar a distintas estructuras segun el orden que se elija, pero siempre se llega a las mismas series base, independientemente del camino que se siga. Esta serie jerarquica agrupada tiene tres niveles que estan dispuestos en 36 subseries. Posteriormente, de los metodos existentes para realizar una prediccion en este tipo de series, se estudian el metodo Bottom-up y el metodo de Combinacion Optima, evaluando su precision de pronostico mediante los errores MAPE y MASE que cometen. Para ello, se toman como datos de entrenamiento los datos entre 1999 y 2012 y se realiza una prediccion mediante ambos metodos para el dato de 2013. A continuacion, se compara el dato estimado con el dato real de 2013 y se evaluan los errores MAPE y MASE cometidos por ambos metodos. Repitiendo este procedimiento para los datos de los anos 2014, 2015, 2016 y 2017 y comparando los errores MAPE y MASE de cada uno, se llega a la conclusion de que el metodo de Combinacion Optima tiene una exactitud un poco mayor que el metodo Bottom-up y menores errores MAPE y MASE de pronostico. Por ultimo, se aplica el modelo de prediccion mediante el metodo de Combinacion Optima a la serie temporal jerarquica agrupada “Total de victimas” para estimar como evolucionara en los proximos cinco anos y tambien cada una de las 36 series que forman parte de esta estructura.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.