데이터 수집과 패널 구성
추정매출, 점포, 생활인구, 집객시설, 상권영역 데이터를 수집해 2021Q1~2026Q1 기준 패널 구조로 만들었습니다.
원본 5개 테이블을 조인해 패널 데이터를 만들고, 컬럼 라벨과 코드값을 한글화해 대시보드에서 바로 해석할 수 있게 정리했습니다. 분석 과정에서 내린 결정과 검증 결과는 별도 decisions 문서에 시간순으로 남겼습니다.
추정매출, 점포, 생활인구, 집객시설, 상권영역 데이터를 수집해 2021Q1~2026Q1 기준 패널 구조로 만들었습니다.
2026Q1 hold-out을 실제 미래 분기로 두고 XGBoost 기반 매출 수준 예측 성능을 검증했습니다.
SHAP Interaction으로 업종×경쟁강도, 상권유형×업종 등 후보 요인을 찾고 상권 고정효과·계절성을 통제했습니다.
Top10/Bottom10, 폐업 위험, 포화도, 유사 상권, 성장 가능성 결과를 Streamlit 대시보드 7개 탭으로 연결했습니다.
매출 순위만 제시하지 않고 생존 위험, 업종 포화도, 성장 가능성을 교차 확인해 최종 후보를 좁히는 과정을 보여줍니다.
성장 가능성, 생존 위험, 포화도를 함께 확인해 우선추천 후보를 좁히는 대표 화면입니다.
매출과 폐업 위험을 함께 비교해 안정형·위험형 상권을 구분합니다.
공급밀도와 수요 조건을 함께 확인해 과포화와 저포화 후보를 구분합니다.
예측 성장률 십분위와 실제 성장률을 비교해 성장 신호의 유효성을 확인합니다.
상위·하위 상권의 차이와 모델이 중요하게 본 변수를 연결해 추천 결과의 근거를 설명합니다.
61개 업종을 가로질러 점포수, 경쟁강도, 집객시설이 Top/Bottom을 가르는 특성으로 반복 확인됐습니다.
성장 예측은 기준선보다 높은 순위상관을 보였고, 예측 성장률 십분위별 실제 성장률이 단조 증가했습니다.
대시보드는 CSV를 읽어 조건별 결과를 보여주며, 데이터 갱신은 파이프라인 스크립트 실행으로 분리했습니다.