LEVEL 80 QUEST
데이터 정제와 ETL 자동화
데이터 정제와 ETL 자동화 — DevFoil 바이브코딩 Stage 17, Lv.80
쓰레기가 들어가면 쓰레기가 나온다
데이터 정제, 왜 필수인가?
수집한 데이터를 그대로 분석에 사용하면 잘못된 결론을 내립니다.
"Garbage In, Garbage Out" - 데이터 과학의 불변 법칙입니다.
현실의 데이터는 누락, 중복, 형식 불일치, 이상값으로 가득합니다. 이를 자동으로 정제하는 ETL 파이프라인을 구축합니다.
이 강의에서 구축하는 것:
현실의 데이터는 누락, 중복, 형식 불일치, 이상값으로 가득합니다. 이를 자동으로 정제하는 ETL 파이프라인을 구축합니다.
이 강의에서 구축하는 것:
- 데이터 클렌징 자동화 (결측값, 이상값 처리)
- 형식 변환 및 표준화
- 중복 데이터 감지 및 제거
- ETL 스크립트 자동화와 스케줄링
데이터 품질 문제 유형
현실에서 마주치는 더러운 데이터들
데이터 품질 문제는 크게 5가지 유형으로 나뉩니다.
| 유형 | 예시 | 해결 방법 |
|---|---|---|
| 결측값 (Missing) | 이름: null, 가격: undefined | 기본값, 평균값, 삭제 |
| 중복 (Duplicates) | 같은 주문이 2번 기록 | 키 기반 중복 제거 |
| 형식 불일치 | "2024-01-01", "01/01/2024" | 표준 포맷으로 통일 |
| 이상값 (Outliers) | 나이: 999, 가격: -1000 | 범위 검증, 통계 기반 필터 |
| 불일치 (Inconsistency) | "서울", "서울시", "Seoul" | 매핑 테이블, 정규화 |
🔒
여기까지는 미리보기입니다
데이터 정제와 ETL 자동화
무료 가입하면 이어서 볼 수 있고, 강의를 완료할 때마다 XP와 레벨이 쌓입니다.
Google로 3초 만에 시작 →🧵 Threads로 시작무료 공개 강의 둘러보기 (Lv.1~3)무료 가입하면 이어서 볼 수 있고, 강의를 완료할 때마다 XP와 레벨이 쌓입니다.