Imputation of Missing Responses on Smoking Habits
Résumé fourni par la source
설문조사에서 흡연과 같은 민감한 건강행태 변수는 무응답이 자주 발생하며, 이는 통계 분석 결과에 편향을 초래할 수 있다. 특히 흡연량은 사회적 낙인과 사생활 침해 우려로 인해 응답 회피가 잦은 변수로, 무응답 자료를 단순히 제거할 경우 표본의 대표성이 훼손되고 모집단 추정의 정확도가 저하될 수 있다. 본 연구는 이러한 문제를 해결하고자, 관측된 건강 지표(예: 연령, 체중, 체성분 등)를 활용하여 흡연량 무응답 사례에 대한 통계적 결측값 대체를 수행하였다. 이를 위해 다중선형회귀모형, 랜덤 포레스트, 극대경사부스팅(XGBoost), 조건부 가우시안 혼합 모형의 네 가지 방법을 적용하였다. 시뮬레이션을 통해 다양한 데이터 구조에서의 대체 성능을 비교한 결과, 군집 구조가 존재하는 경우에는 조건부 가우시안 혼합 모형이 상대적으로 우수한 성능을 보였고, 비선형성이 강한 구조에서는 트리 기반 머신러닝 기법들이 더 효과적인 대체 결과를 제시하였다. 실제 국민건강영양조사 자료에 본 방법들을 적용한 결과, 흡연량 무응답자의 대체값은 기존 통계보다 다소 높은 흡연율을 시사하였다. 본 연구는 민감한 건강행태 변수의 결측 처리시 자료의 구조적 특성에 따라 적절한 방법론을 선택하는 것이 중요하며, 이를 통해 보건 통계의 정확도를 향상시킬 수 있음을 실증적으로 보여준다.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Contrôle bibliographique ouvert
DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.
- Titre Crossref
- Imputation of Missing Responses on Smoking Habits
- Date Crossref
- 31/10/2025
- Éditeur
- The Korean Data Analysis Society
- Type
- journal-article
Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude et ne compte pas comme une seconde source scientifique indépendante.