작업 목록
주요 작업자동화데이터AI마케팅

인스타 오디언스 분석

팔로워가 실제로 누구인지 — 국적 분포와 페이크 비율

계정의 팔로워를 수집해 국적 분포와 페이크 의심 비율을 산출하고, 맞팔 여부를 대조해 승인한 대상만 정리한다.

팔로워 국적 · 페이크 판별 · 팔로잉 정리

역할
설계 · 개발 · 테스트
분류
자동화, 데이터, AI, 마케팅
등급
주요 작업 — 구조와 판단이 남아 있는 것

화면 캡처가 아직 없어, 아래에 구조와 판단으로 적었습니다.

01

무슨 문제였나

계정의 오디언스가 실제로 누구인지 알 방법이 없다. 팔로워 수만으로는 광고 가치도, 정리 대상도 판단할 수 없다.

02

어떻게 풀었나

수집을 중단 지점부터 재개할 수 있게 만들고, 판별은 여러 신호의 가중 합으로 설계하되 단일 신호로는 결론이 나지 않도록 임계값을 잡았다.

구조

  1. 01세션 · 설정
  2. 02커서 페이지네이션 수집 + 중단 재개
  3. 03텍스트 · 국적 · 페이크 스코어링
  4. 04가중치 / 임계값 판정
  5. 05SQLite 저장 (중첩 안전 트랜잭션)
  6. 06리포트 / 정리 대상 승인

어려웠던 것

  • 이름 기반 국적 추정의 오탐 — 영어·베트남어 단어와 충돌하는 성씨를 제거하고 커버리지 손실을 감수
  • 수집 속도와 차단 위험의 균형 — 딜레이·백오프·세션 분리
03

무엇을 만들었나

  • 표본이 아니라 전수 수집 — 팔로워 수에 따라 몇 시간이 걸린다고 먼저 말한다
  • 커서 페이지네이션 + 중단 지점 재개
  • SAVEPOINT 기반 중첩 안전 트랜잭션
  • 얕은 재수집이 기존 상세 데이터를 덮지 않는 병합 규칙
  • 가중치 기반 스코어링 — 단일 신호로 확정 불가
  • 모듈 간 의존 격리 검사기 (허용목록 방식)
  • 승인한 대상만 사람 속도로 처리

쓴 기술

PythonSQLitepytest브라우저 세션 자동화
04

무엇이 남았나

  • 스코어링 오탐 제거
  • 테스트 118개 통과

알게 된 것

판별 로직은 신호를 많이 넣는 것보다, 어떤 신호도 혼자서는 결론을 내지 못하게 만드는 게 중요했다.

다음 프로젝트플랫폼 알고리즘 레퍼런스