Personal Project · Marketing Analytics · Python Pipeline

콘텐츠 마케팅 성과 진단 자동화

과거 콘텐츠 성과를 바탕으로 신규 콘텐츠의 예상 CTR 범위와 유사 사례를 진단하고, reach 분석·다변량 회귀·발행 전략까지 입력 데이터에 맞춰 다시 계산하는 대시보드로 확장했습니다.

문제 정의

발행 전 성과 판단을 경험과 감이 아닌 과거 데이터 비교 문제로 바꿨습니다.

해결 방향

데이터를 교체해도 같은 검증 절차와 시각화가 재현되는 분석 도구를 만들었습니다.

69건정제 후 과거 콘텐츠
5건신규 콘텐츠 진단
22%예상 CTR 구간 폭 감소
5개 탭진단·패턴·reach·회귀·전략
분석 판단

높아 보이는 평균보다, 반복 검증할 수 있는 기준을 선택했습니다.

표본이 69건으로 작아 복잡한 예측 모델 대신 type과 channel을 앵커로 고정한 유사 콘텐츠 비교를 선택했습니다. 이후 reach와 다변량 회귀를 별도 분석해 단순 평균에 섞인 신호와 변수 간 중복을 구분했습니다.

01

분석 데이터 정제

원본 70건에서 중복 콘텐츠와 결측 성과값을 정리해 비교 가능한 69건을 구성하고, 이모지 여부 등 분석용 변수를 표준화했습니다.

02

유사 콘텐츠 기준 설계

type과 channel을 앵커로 고정하고 게시 시간·이모지 여부를 보조 점수로 사용해 신규 콘텐츠별 유사 사례 TOP3를 선정했습니다.

03

가중치 통계 검증

ANOVA와 Welch t-test에서 CTR과 관계가 확인되지 않은 topic_category를 가중치에서 제외했습니다.

04

인터랙티브 대시보드 확장

CSV·Excel 업로드, 신규 콘텐츠 일괄 진단, reach 분석, 회귀·VIF·부분 F검정과 전략 우선순위를 Streamlit 탭으로 연결했습니다.

시각화 근거

진단부터 검증과 실행 전략까지, 다섯 개의 화면으로 보여줍니다.

각 화면은 데이터 입력, 콘텐츠별 판단, 통계 검증, 실행 우선순위로 이어지는 분석 흐름을 보여줍니다. 캡처 이미지는 준비되는 순서대로 아래 슬롯에 연결합니다.

학습 콘텐츠와 진단 대상 수, 발행 시간대와 이모지 효과, 유형과 채널별 평균 CTR을 보여주는 대시보드 개요 화면
01. 핵심 성과 패턴

학습·진단 건수, 발행 시간대·이모지 효과, 모델 설명력과 평균 CTR 차트가 함께 보이는 화면입니다.

신규 콘텐츠 일괄 진단표와 개별 콘텐츠의 예상 CTR, 유사 콘텐츠 TOP3, 개선 제안을 보여주는 화면
02. 발행 전 의사결정

예상 CTR 범위, 유사 콘텐츠 TOP3, 매칭 근거와 개선 제안을 한 번에 확인하는 화면입니다.

다른 조건을 통제한 뒤 변수별 CTR 계수와 표준오차를 비교하는 다변량 회귀분석 화면
03. 변수별 순수 효과

유형·채널·시간대·이모지를 동시에 통제하고 각 조건이 CTR에 미치는 순수 효과와 불확실성을 비교합니다.

다른 변수와 중복되는 정보를 확인하기 위한 변수별 VIF 분석 화면
04. 변수 간 중복 신호

VIF 10을 기준으로 type과 channel 항목의 다중공선성을 확인하고 회귀계수 해석의 한계를 구분합니다.

발행 시간대 재배치와 이미지 체크리스트 도입 전략의 근거, 예상 효과와 우선순위 점수를 보여주는 화면
05. 실행 전략 우선순위

관찰된 성과 차이와 실행 용이도를 평가해 우선 적용할 기획안을 정리한 화면입니다.

핵심 결과
분석 결과만 제시하지 않고, 데이터 교체부터 진단·검증·전략 도출까지 직접 탐색할 수 있는 도구로 만들었습니다.

예측 정밀도 검증

leave-one-out 백테스트에서 topic_category를 제외해 정확도 손실 없이 예상 CTR 구간 폭을 22% 줄였습니다.

reach 확장 분석

reach와 CTR·참여율의 강한 상관이 type+channel을 통제한 뒤에도 유지되는지 편상관으로 확인했습니다.

중복 신호 분리

다변량 회귀, VIF와 부분 F검정으로 type과 channel이 겹쳐 설명하는 신호를 점검하고 앵커 설계를 재검증했습니다.

한계와 개선

패턴 기반 진단의 적용 범위를 명확히 제한했습니다.

  • 69건의 작은 표본과 특정 시점의 콘텐츠 구성에 기반하므로 결과를 절대적인 CTR 예측값으로 해석할 수 없습니다.
  • 22% 개선은 예측 정확도 향상이 아니라 leave-one-out 백테스트에서 예상 CTR 구간 폭이 감소한 결과입니다.
  • 게시 시간과 이모지 효과는 데이터가 갱신되면 달라질 수 있어 동일한 통계 검정을 다시 수행해야 합니다.
  • reach와 성과의 상관은 강하지만 관찰 데이터만으로 원인과 알고리즘 피드백 효과를 구분할 수 없습니다.
  • 후속 단계에서는 실제 발행 결과를 수집해 진단 범위의 포함률과 개선안 실행 효과를 검증해야 합니다.