269 단어
1 분
정답 컬럼을 빼도 데이터 누수가 생길까?
2026-09-27
data leakage에 관한 학습 포스팅 예시다.
전체 데이터로 평균과 표준편차를 계산한 뒤 학습·평가를 나눴다. 정답을 전처리에 쓰지 않았으니 괜찮을까?
먼저 생각해 보기
평가 데이터의 어떤 정보가 학습 과정에 전달되었는지 설명해 보자.
생각한 뒤 답 보기
평가 데이터의 분포가 전처리 통계에 들어가면 학습 과정이 평가 데이터 정보를 이용한다. 먼저 분할하고 학습 데이터로만 전처리를 fit한 뒤 평가 데이터에는 transform을 적용해야 한다. scikit-learn Pipeline은 이런 누수를 줄이는 데 도움이 된다. 하지만 미래 정보를 담은 특성이나 시간·사용자 단위의 잘못된 분할까지 자동 해결하지는 않는다.
근거: 원문 자료.
다음 질문
같은 사용자가 학습과 평가에 모두 등장한다면 항상 누수일까?