분석 데이터 정제
원본 70건에서 중복 콘텐츠와 결측 성과값을 정리해 비교 가능한 69건을 구성하고, 이모지 여부 등 분석용 변수를 표준화했습니다.
Personal Project · Marketing Analytics · Python Pipeline
과거 콘텐츠 성과를 바탕으로 신규 콘텐츠의 예상 CTR 범위와 유사 사례를 진단하고, reach 분석·다변량 회귀·발행 전략까지 입력 데이터에 맞춰 다시 계산하는 대시보드로 확장했습니다.
표본이 69건으로 작아 복잡한 예측 모델 대신 type과 channel을 앵커로 고정한 유사 콘텐츠 비교를 선택했습니다. 이후 reach와 다변량 회귀를 별도 분석해 단순 평균에 섞인 신호와 변수 간 중복을 구분했습니다.
원본 70건에서 중복 콘텐츠와 결측 성과값을 정리해 비교 가능한 69건을 구성하고, 이모지 여부 등 분석용 변수를 표준화했습니다.
type과 channel을 앵커로 고정하고 게시 시간·이모지 여부를 보조 점수로 사용해 신규 콘텐츠별 유사 사례 TOP3를 선정했습니다.
ANOVA와 Welch t-test에서 CTR과 관계가 확인되지 않은 topic_category를 가중치에서 제외했습니다.
CSV·Excel 업로드, 신규 콘텐츠 일괄 진단, reach 분석, 회귀·VIF·부분 F검정과 전략 우선순위를 Streamlit 탭으로 연결했습니다.
각 화면은 데이터 입력, 콘텐츠별 판단, 통계 검증, 실행 우선순위로 이어지는 분석 흐름을 보여줍니다. 캡처 이미지는 준비되는 순서대로 아래 슬롯에 연결합니다.
학습·진단 건수, 발행 시간대·이모지 효과, 모델 설명력과 평균 CTR 차트가 함께 보이는 화면입니다.
예상 CTR 범위, 유사 콘텐츠 TOP3, 매칭 근거와 개선 제안을 한 번에 확인하는 화면입니다.
유형·채널·시간대·이모지를 동시에 통제하고 각 조건이 CTR에 미치는 순수 효과와 불확실성을 비교합니다.
VIF 10을 기준으로 type과 channel 항목의 다중공선성을 확인하고 회귀계수 해석의 한계를 구분합니다.
관찰된 성과 차이와 실행 용이도를 평가해 우선 적용할 기획안을 정리한 화면입니다.
leave-one-out 백테스트에서 topic_category를 제외해 정확도 손실 없이 예상 CTR 구간 폭을 22% 줄였습니다.
reach와 CTR·참여율의 강한 상관이 type+channel을 통제한 뒤에도 유지되는지 편상관으로 확인했습니다.
다변량 회귀, VIF와 부분 F검정으로 type과 channel이 겹쳐 설명하는 신호를 점검하고 앵커 설계를 재검증했습니다.