본문 바로가기
728x90

전체 글39

“모델 성능이 너무 좋다면?”…데이터 누수 막는 분할과 Pipeline 검증 정확도가 유난히 높다가 실제 운영에서 무너진다면 모델보다 데이터 누수를 먼저 의심해야 합니다. 데이터 누수는 예측 시점에는 알 수 없는 정보가 학습 과정에 들어가 검증 성능을 실제보다 좋게 만드는 문제입니다.[1]가장 기본적인 예방 원칙은 간단합니다. 먼저 학습·검증 데이터를 나누고, 결측치 대체·스케일링·변수선택 같은 전처리는 학습 데이터에서만 학습해야 합니다.테스트 데이터에는 fit하지 마세요데이터 누수는 어떻게 생기나누수는 정답 열을 그대로 특성에 넣는 실수만 뜻하지 않습니다. 실무에서는 더 간접적인 형태로 발생합니다.전처리 누수전체 데이터의 평균과 표준편차로 스케일링한 뒤 데이터를 나누면 테스트 데이터의 분포가 학습에 반영됩니다. 전체 데이터의 중앙값으로 결측치를 채우거나 전체 데이터로 상위.. 2026. 10. 2.
“상관계수 0이면 관계가 없다?”…Pearson과 Spearman 선택법 상관계수가 0에 가깝다고 두 변수 사이에 아무 관계도 없다고 단정할 수는 없습니다. Pearson 상관계수는 주로 선형 관계를 측정하므로 U자형처럼 뚜렷한 비선형 관계에서도 0 근처가 나올 수 있습니다.[1]상관분석은 숫자를 계산하는 것보다 산점도로 관계의 모양을 보고, 변수의 척도와 이상값을 확인하고, Pearson과 Spearman 중 질문에 맞는 방법을 고르는 순서가 중요합니다.상관계수보다 먼저 산점도를 보세요Pearson 상관계수가 보는 것Pearson 상관계수 r은 두 수치형 변수의 선형 관계 방향과 강도를 -1부터 1 사이 값으로 요약합니다.[1]r이 1에 가까움: 강한 양의 선형 관계r이 -1에 가까움: 강한 음의 선형 관계r이 0에 가까움: 선형 관계가 약함여기서 마지막 문장이 중요합니다... 2026. 10. 2.
“정확도 99%인데 실패한 모델?”…불균형 데이터 평가 지표 읽는 법 사기거래 10건과 정상거래 990건이 있는 데이터에서 모든 거래를 정상이라고 예측하면 정확도는 99%입니다. 하지만 사기거래는 단 한 건도 찾지 못합니다.클래스 비율이 크게 다른 문제에서는 정확도 하나로 모델을 평가하면 안 됩니다. 혼동행렬을 먼저 보고, 업무 비용에 따라 정밀도·재현율·균형정확도와 임계값을 함께 선택해야 합니다.높은 정확도가 중요한 대상을 잘 찾았다는 뜻은 아닙니다99% 정확도의 착시다음과 같은 테스트 데이터가 있다고 해보겠습니다.정상거래: 990건사기거래: 10건모델 예측: 1,000건 전부 정상정확도는 전체 예측 중 맞힌 비율입니다.정확도 = 990 ÷ 1,000 = 99%그러나 사기거래 재현율은 0%입니다. 실제 사기 10건 중 잡아낸 건수가 0건이기 때문입니다.이 모델은 숫자상 .. 2026. 10. 2.
“결측치를 0으로 채우면 끝?”…pandas 결측치 처리 순서와 판단 기준 결측치를 모두 0으로 바꾸면 코드는 빨리 실행되지만 분석 의미가 달라질 수 있습니다. ‘구매금액 0원’은 구매하지 않았다는 관측값이고, NaN은 금액을 알 수 없다는 상태일 수 있기 때문입니다.결측치 처리는 함수 선택보다 왜 비었는지 확인하는 일이 먼저입니다. 탐지하고, 분포를 비교하고, 삭제·대체·별도 표시 중 방법을 고른 뒤 결과가 얼마나 달라지는지 검증해야 합니다.비어 있다는 사실도 하나의 정보일 수 있습니다0과 결측치는 무엇이 다른가쇼핑몰 주문 데이터에서 다음 세 값은 서로 다른 뜻을 가집니다.값가능한 의미0쿠폰 할인액이 실제로 0원NaN 또는 pd.NA할인액을 수집하지 못함빈 문자열 ""입력값이 비었지만 결측치로 변환되지 않음빈 문자열, -999, 미입력, N/A처럼 시스템마다 다른 표시를 먼저.. 2026. 10. 1.
“평균 매출은 올랐는데 왜 체감은 그대로?”…평균·중앙값을 고르는 법 평균이 올랐는데 대부분의 매장이 변화를 느끼지 못한다면 일부 큰 값이 평균을 끌어올렸을 가능성이 있습니다. 이럴 때는 평균만 보지 말고 중앙값, 사분위수, 분포 그래프를 함께 확인해야 합니다.평균과 중앙값 중 하나가 항상 더 좋은 것은 아닙니다. 분석 목적이 전체 합계와 연결되는지, 전형적인 대상을 설명하려는지, 극단값이 오류인지 실제 사건인지에 따라 선택이 달라집니다.대표값을 고르기 전에 분포의 모양부터 보세요다섯 개 매장으로 보는 차이어느 날 다섯 매장의 매출이 다음과 같다고 해보겠습니다.100, 110, 120, 130, 1,000만원평균은 모든 값을 더해 개수로 나눕니다.(100 + 110 + 120 + 130 + 1,000) ÷ 5 = 292만원중앙값은 값을 크기순으로 놓았을 때 가운데 값입니다.. 2026. 10. 1.
파이썬 데이터분석 판다스 대용량 CSV 메모리 초과 해결법 수 기가바이트(GB)에 달하는 로그 데이터나 실거래가 원천 데이터를 파이썬으로 불러올 때 커널이 갑작스럽게 죽거나 MemoryError(OOM)가 발생하는 현상으로 분석 작업이 중단되는 경우가 빈번합니다. 컴퓨터 사양을 무작정 높이지 않고도 기존 램(RAM) 환경에서 대용량 데이터를 고속으로 가공하려면 파이썬 데이터분석 판다스의 내부 메모리 할당 구조를 파악하고 최적화 파이프라인을 구축해야 합니다. 이번 글에서는 판다스의 메모리 누수 요인을 분해하고 데이터 타입을 재정의하여 메모리 사용량을 80% 이상 감축시키는 3단계 액션 플랜을 상세히 정리해 드립니다.1. 판다스 메모리 적재 원리와 기본 한계파이썬의 대표적인 데이터 가공 라이브러리인 판다스(Pandas)는 모든 데이터를 시스템 메모리에 한꺼번에 올려.. 2026. 9. 30.
728x90