작업 목록01 02 03 04 다음 프로젝트
인스타 오디언스 분석
팔로워가 실제로 누구인지 — 국적 분포와 페이크 비율
계정의 팔로워를 수집해 국적 분포와 페이크 의심 비율을 산출하고, 맞팔 여부를 대조해 승인한 대상만 정리한다.
팔로워 국적 · 페이크 판별 · 팔로잉 정리
- 역할
- 설계 · 개발 · 테스트
- 분류
- 자동화, 데이터, AI, 마케팅
- 등급
- 주요 작업 — 구조와 판단이 남아 있는 것
화면 캡처가 아직 없어, 아래에 구조와 판단으로 적었습니다.
무슨 문제였나
계정의 오디언스가 실제로 누구인지 알 방법이 없다. 팔로워 수만으로는 광고 가치도, 정리 대상도 판단할 수 없다.
어떻게 풀었나
수집을 중단 지점부터 재개할 수 있게 만들고, 판별은 여러 신호의 가중 합으로 설계하되 단일 신호로는 결론이 나지 않도록 임계값을 잡았다.
구조
- 01세션 · 설정
- 02커서 페이지네이션 수집 + 중단 재개
- 03텍스트 · 국적 · 페이크 스코어링
- 04가중치 / 임계값 판정
- 05SQLite 저장 (중첩 안전 트랜잭션)
- 06리포트 / 정리 대상 승인
어려웠던 것
- 이름 기반 국적 추정의 오탐 — 영어·베트남어 단어와 충돌하는 성씨를 제거하고 커버리지 손실을 감수
- 수집 속도와 차단 위험의 균형 — 딜레이·백오프·세션 분리
무엇을 만들었나
- 표본이 아니라 전수 수집 — 팔로워 수에 따라 몇 시간이 걸린다고 먼저 말한다
- 커서 페이지네이션 + 중단 지점 재개
- SAVEPOINT 기반 중첩 안전 트랜잭션
- 얕은 재수집이 기존 상세 데이터를 덮지 않는 병합 규칙
- 가중치 기반 스코어링 — 단일 신호로 확정 불가
- 모듈 간 의존 격리 검사기 (허용목록 방식)
- 승인한 대상만 사람 속도로 처리
쓴 기술
PythonSQLitepytest브라우저 세션 자동화
무엇이 남았나
- 스코어링 오탐 제거
- 테스트 118개 통과
알게 된 것
판별 로직은 신호를 많이 넣는 것보다, 어떤 신호도 혼자서는 결론을 내지 못하게 만드는 게 중요했다.


