실무에 바로 쓰는 바닥부터 시작하는 머신러닝 2-3 [完]
캐글 데이터셋 다운 받기
캐글은 모델을 개발하는데 필요한 데이터셋과 도구를 제공해 주는 경진대회 플랫폼이다.
데이터를 다운로드 받기위해서 계정이 필요하고 계정이있다면 API키를 생성하여 쉽게 다운로드 받을수있다.

캐글 속성에서 api를 다운로드 하고 난후 사용자폴더/.kaggle 생성후 저장해주기만 하면 된다.
이후 프롬포트를 사용해서 kaggle competitions download -c titanic 입력하게 되면 캐글에 있는 titanic 데이터가
저장되는걸 확인할수있다.
데이터 전처리
데이터 분석 및 머신러닝 모델링을 위해 데이터를 준비하는 필수적인 과정.

결측값 처리
결측값 제거
dropna()함수를 사용하여 , 결측값이 들어가있는 열이나 행을 삭제한다.

열을 기준으로 할꺼면 axis =1을 넣어주면 된다. 확인하면 , NaN이 안들어있는 행은 없기에 모든 행이 지워진걸
확인 할수 있고 , 열을 기준으로 했을때 c열에만 NaN값이 없기에 c열만 보여지는걸 확인할수있다.
결측값 대체
fillna()함수를 사용하여 , 결측값을 전달된 값으로 변경시켜준다.

사용 할때 , 문자열 같은 경우 평균값이나 최대값등으로 대체 할수 없기에 데이터를 확인하고,
적절하게 값을 집어 넣어 대체를 진행하여야 한다.
이상치 처리
IQR 을 통해 이상치를 확인 할수있다.

사용하게 되면 c열의 이상치로 예상되는 행이 나오게 된다.
이후 해당행을 삭제하는 것도 가능하다.
중복값 제거
duplicated() 를 사용하여 간단하게 중복된 열을 확인 할수있고 , drop_duplicates()를 통해 제거할수있다.

데이터 타입 변환
Pandas의 astype() 메서드를 사용하여 데이터 타입을 쉽게 변환할수있다.

c열이 int로 이후 float로 변환된걸 확인할수있다.
인코딩
범주형 데이터를 수치형 데이터로 변환하는 과정이며 ,
Pandas의 get_dummies() 메서드를 사용하여 범주형 데이터를 더미 변수로 변환할수있다.

샘플링
데이터셋에서 임의의 데이터를 가지고 오는 기능이며
.sample 로 사용한다. 비율을 frac으로 전달할수도 있고 n으로 전달도 가능하다

파이썬 라이브러리에서 배웠던 내용들이 많아서 복습하는 느낌으로 다시 한번 들었다.
확실히 들었던 내용들이여서 좀 쉽게쉽게 이해하고 넘어간거 같다.
'나의개발일지(TIL)' 카테고리의 다른 글
| TIL 11일차 -머신러닝 (0) | 2024.10.18 |
|---|---|
| 나의개발일지(TIL)[스파르타 내일배움캠프]10일차 -머신러닝 (0) | 2024.10.17 |
| [스파르타 내일배움캠프]8일차 -머신러닝 (0) | 2024.10.14 |
| [스파르타 내일배움캠프]7일차 -파이썬 라이브러리 (0) | 2024.10.11 |
| [스파르타 내일배움캠프]6일차 -파이썬 라이브러리 (0) | 2024.10.10 |