EDA로 단서 찾기
월별 성적, 홈/원정, 1점 차 경기 승률, 불펜 세이브 상황을 비교해 접전 경기 운영 문제를 확인했습니다.
단순 순위 비교로 끝내지 않고, 시간적 누수를 줄이는 검증 방식과 모델 해석 방법을 함께 사용했습니다. 같은 연도 데이터가 train/test에 섞이지 않도록 Group K-Fold를 적용했습니다.
월별 성적, 홈/원정, 1점 차 경기 승률, 불펜 세이브 상황을 비교해 접전 경기 운영 문제를 확인했습니다.
2015~2024년 MLB 팀 시즌 데이터로 피타고리안 잔차 예측 모델을 만들고 Ridge, Lasso, Random Forest, XGBoost를 비교했습니다.
Permutation Importance와 SHAP으로 onerun_wp, rs_per_g, SV_pg, sv_pct, ERA, ir_pct의 영향을 교차 확인했습니다.
Markov Chain과 Monte Carlo Simulation으로 시즌 흐름을 재현하고 NSGA-II로 개선 시나리오를 도출했습니다.
피타고리안 기대 승수에서 출발해 잔차 원인, 변수 영향도, 개선 시나리오를 순서대로 보여주는 구조로 정리합니다.
시즌 성과를 먼저 요약해 기대 승수와 실제 승수 차이를 해석할 배경을 만듭니다.
90.1승 기대치와 실제 81승 사이의 차이를 프로젝트의 출발점으로 보여줍니다.
접전 운영, 불펜 안정성, 득점 생산성 등 주요 변수를 해석합니다.
운영 개선안별 기대 승수 변화와 현실적인 개선 방향을 보여줍니다.
1점 차 경기 승률 42.0%가 리그 평균보다 낮아 실제 승수 괴리의 핵심 단서가 됐습니다.
세이브 관련 지표와 ERA가 잔차 설명에 반복적으로 등장해 마무리 운영 개선 필요성을 보였습니다.
Balanced 시나리오에서는 마무리 보강, 선발 피홈런 억제, 타선 생산성 개선이 현실적 대안으로 정리됐습니다.