LEVEL 98 QUEST
Feature Store & 데이터 전처리 파이프라인
ML 모델의 80%는 데이터 전처리가 결정한다! Feature Store로 수백 개 피처를 실시간 제공하는 MLOps 인프라 구축
LEVEL 98 - ML PIPELINE & PREDICTION ENGINE
ML 성능의 80%는 피처가 결정한다!
Feature Store
Uber Michelangelo, Spotify Feathr, Netflix Metaflow의 공통점?
모두 Feature Store를 MLOps의 핵심 인프라로 사용합니다
수백 개의 피처를 밀리초 단위로 서빙하는
프로덕션 그레이드 Feature Store를 직접 구축합니다
1 Feature Store 아키텍처 개론
Feature Store는 ML 모델이 필요로 하는 피처(feature)를 중앙에서 관리하고, 학습과 서빙 모두에 일관된 피처를 제공하는 인프라입니다. Netflix는 이를 통해 수천 개의 ML 모델에 일관된 피처를 제공하고 있습니다.
500+
관리 피처 수
<5ms
Online 서빙 지연
99.99%
피처 일관성
Offline Feature Store (Batch)
용도: 모델 학습용 피처 제공
- 대용량 데이터 배치 처리
- 히스토리컬 피처 조인
- 수 TB 규모 데이터 지원
- Point-in-time correct join
- Parquet/Delta Lake 저장
핵심: 시간 여행(time travel) 쿼리로
과거 특정 시점의 피처값을 정확히 복원
- 대용량 데이터 배치 처리
- 히스토리컬 피처 조인
- 수 TB 규모 데이터 지원
- Point-in-time correct join
- Parquet/Delta Lake 저장
핵심: 시간 여행(time travel) 쿼리로
과거 특정 시점의 피처값을 정확히 복원
Online Feature Store (실시간)
용도: 모델 추론 시 실시간 피처 서빙
- 밀리초 단위 응답 (p99 < 5ms)
- 키-값 기반 빠른 조회
- Redis/DynamoDB 백엔드
- 스트리밍 피처 업데이트
- 높은 QPS (초당 100K+)
핵심: 학습 때 사용한 피처와
동일한 값을 서빙 시에도 보장
- 밀리초 단위 응답 (p99 < 5ms)
- 키-값 기반 빠른 조회
- Redis/DynamoDB 백엔드
- 스트리밍 피처 업데이트
- 높은 QPS (초당 100K+)
핵심: 학습 때 사용한 피처와
동일한 값을 서빙 시에도 보장
Raw Data
→
Feature Engineering
→
Feature Store
→
Offline (Training)
|
Online (Serving)
Uber Michelangelo Feature Store
Uber는 Feature Store를 통해 수만 개의 피처를 수천 개 모델에 공유합니다.
한 팀이 만든 "지역별 평균 수요" 피처를 다른 팀의 "가격 예측 모델"에서 재사용하는 식입니다.
Feature reusability가 ML 생산성의 핵심입니다.
🔒
여기까지는 미리보기입니다
Feature Store & 데이터 전처리 파이프라인
무료 가입하면 이어서 볼 수 있고, 강의를 완료할 때마다 XP와 레벨이 쌓입니다.
Google로 3초 만에 시작 →🧵 Threads로 시작무료 공개 강의 둘러보기 (Lv.1~3)무료 가입하면 이어서 볼 수 있고, 강의를 완료할 때마다 XP와 레벨이 쌓입니다.