전체 글 13

TIL 13일차 - 딥러닝

인공 신경망 (ANN) 어제 파이토치를 설치만 하고 오늘부터 실습을 시작했는데, 파이토치가 정상적으로 실행이 되지 않는 문제가 발생했다.그래픽카드가 지원하는 cuda를 설치하지 않아서 pytorch와 호환문제로 진행이 되지않았다고 생각하고,cuda toolkit과 cuDNN도 설치를 진행해보았지만, 해결되지 않았다.이후 해결 방법은 프롬포트에서 conda list를 통해  설치된 cuda 버전을 확인하고 uninstall  이후 pytorch에서 제공하는 설치코드로 설치를 진행했는데 cuda가 아니라 cpu에 맞춰놓고 작업을 진행했다.그래도 진행되지 않아서 쥬피터 노트북에서 torch를 직접 설치 진행하였고 이후 코드가 정상적으로 작동하였다. pytorch의 기원이 되는 torch를 직접 설치 해줬고 이..

TIL 12일차 - 딥러닝

딥러닝개념 인공 신경망을 기반으로한 기계 학습의 한분야다층 신경망을 사용하여 데이터로부터 특징을 자동으로 학습하고 이를 통해 복잡한 문제를 해결한다.입력 데이터에서 중요한 패턴을 추출하고 , 이를 바탕으로 예측 , 분류 , 생성 등의 다양한 작업을 수행한다. 딥러닝의 특징비선형 추론 : 딥러닝은 비선형 추론을 통해 복잡한 데이터의 패턴을 학습할수 있다.다층 구조 : 여러 층의 신경망을 사용하여 데이터의 고차원 특징을 학습한다.자동 특징 추출 : 데이터로부터 중요한 특징을 자동으로 추출하여 별도의 특징 공학 과정이 필요없다.인공지능 , 머신러닝 , 딥러닝의 관계인공지능 : 인간의 지능을 모방하여 문제를 해결하는 기술 .                   규칙 기반 시스템부터 자율 학습 시스템까지 다양한 접근..

TIL 11일차 -머신러닝

실무에 바로 쓰는 바닥부터 시작하는 머신러닝 4-6  [完]실무에 바로 쓰는 바닥부터 시작하는 머신러닝 5-4  [完]   비지도 학습 : 군집화 모델k-means clustering 개념  알고리즘의 단계초기화 -k개의 군집 중심을 랜덤하게 설정.할당 단계  - 각 데이터 포인트를 가장 가까운 군집 중심에 할당.업데이트 단계 - 각 군집의 중심을 해당 군집에 속한 데이터 포인트들의 평균으로 업데이트.반복 - 할당 단계와 업데이트 간계를 군집 중심이 더 이상 변화하지 않을때 까지 반복    데이터가 수치형이어야 거리를 구할수있기 때문에 필요한 열만 따로 선택하고 ,이후 스케일링을 진행한다. 엘보우 방식으로 모델 학습 및 군집화엘보우 방식은 최적의 k를 선택하는데 사용되며 ,k를 증가시키면서 각 k에 대한..

나의개발일지(TIL)[스파르타 내일배움캠프]10일차 -머신러닝

실무에 바로 쓰는 바닥부터 시작하는 머신러닝 3-6  [完]   지도학습 : 회귀모델선형회귀종속 변수와 하나 이상의 독립 변수 간의 선형관계를 모델링하는 방법이다.독립변수의 수에 따라 단순 선형회귀와 다중 선형회귀로 나뉜다. 학습이란?머신러닝에는 가중치라는것이 잇고 가중치에 따라 예측값이 결정됨 예측치와 실제값의 차이의 오차를 계산할수있고,이 오차를 최소화할수있는 법은 미분이있다. 이 미분을 통해 가중치를 바꿔가며 오차가 줄어들게 하는것이다 오차가 줄어드는 이 과정을 학습이라한다. Scilkit-learn을 사용한 선형 회귀 모델 구현 및 평가 학습과 테스트 데이터로 나누는 과정인데 , train_test_split 함수를 사용하고 첫째인자를 독립변수 X ,두번째로 종속변수y를 넣어준다. test_siz..

[스파르타 내일배움캠프]9일차 -머신러닝

실무에 바로 쓰는 바닥부터 시작하는 머신러닝 2-3  [完]   캐글 데이터셋 다운 받기캐글은 모델을 개발하는데 필요한 데이터셋과 도구를 제공해 주는 경진대회 플랫폼이다. 데이터를 다운로드 받기위해서 계정이 필요하고 계정이있다면 API키를 생성하여 쉽게 다운로드 받을수있다.캐글 속성에서 api를 다운로드 하고 난후 사용자폴더/.kaggle 생성후 저장해주기만 하면 된다.이후 프롬포트를 사용해서  kaggle competitions download -c titanic 입력하게 되면 캐글에 있는 titanic 데이터가 저장되는걸 확인할수있다. 데이터 전처리데이터 분석 및 머신러닝 모델링을 위해 데이터를 준비하는 필수적인 과정.  결측값 처리 결측값 제거dropna()함수를 사용하여 , 결측값이 들어가있는 열..

[스파르타 내일배움캠프]8일차 -머신러닝

실무에 바로 쓰는 바닥부터 시작하는 머신러닝 1-4  [完]    머신러닝의 정의컴퓨터가 명시적으로 프로그래밍 되지 않아도 데이터를 통해 학습하고 , 예측할 수 있도록 하는 기능대량의 데이터를 알고리즘에 입력하여 학습과정을 통해 모델을 생성하고 예측을 수행.전통적이 프로그래밍-규칙과 논리를 프로그래머가 직접 정의-명시적 명령과 조건문을 통해 문제 해결머신러닝-데이터를 이용해 패턴과 규칙을 스스로 학습-예측 모델을 통해 새로운 데이터에 대한 결과 도출-프로그램이 아닌 모델이 중심 머신러닝의 구성요소데이터셋 : 모델을 학습시키기 위한 데이터 모음입력/출력 데이터로 구성되어 있고 입력데이터는 모델이 학습할수 있는 정보출력데이터(레이블)은 모델이 예측해야 하는 목표값으로 이루어져 있다.특징 : 데이터셋에서 모델..

[스파르타 내일배움캠프]7일차 -파이썬 라이브러리

10. 4. 21:00  인공지능을 위한 파이썬 라이브러리 6-3[完]  판다스 심화 : 멀티 인덱스와 복합 인덱스 멀티 인덱스란하나 이상의 인덱스를 사용하여 데이터프레임과 행과 열을 구조화 하는 방법이다.이는 다차원 데이터를 보다 효율적으로 관리하고 분석할수 있게 해준다. set_index()로 멀티 인덱스 설정 인덱스로 도시와 년도가 설정되어서 데이터가 구조화 된걸 확인할수있다.   pd.MultiIndex.from_tuples() 로 멀티 인덱스 생성from_tuples()을 사용해 튜플로 구성된 멀티 인덱스를 생성할 수도 있다. MultiIndex - 이코드는 멀티인덱스 객체를 생성하는 부분from.tuples - 멀티인덱스를 구성할 튜플의 리스트를 받아서 멀티인덱스 객체를 반환해주는 작업Mult..

[스파르타 내일배움캠프]6일차 -파이썬 라이브러리

development-1 2024. 10. 7. 19:43  development-1 2024. 10. 4. 21:00  인공지능을 위한 파이썬 라이브러리 5-4 [完]  데이터 전처리 : 결측치 탐지와 다양한 처리 방법  데이터 분석에서 결측치는 흔해 발생하며 , 이를 올바르게 처리하는것이 중요하다.판다스는 결측치를 쉽게 탐지하고 처리할수 있는 다양한 기능을 제공한다. 결측치는 어떻게 채우느냐가 중요하며, 결측치 유형무작위적 결측치 .결측치 발생이 다른변수와 관련이 없는경우.결측치의 발생이 특정 변수와 관련이 있는경우.이렇게 3가지가 존재한다 isna() 와 isnull로 결측치 탐지 예시 데이터 프레임을 생성하고 실행할시 민수의 나이와 지수의 직업이 NaN 과 None 으로 표시된다.이후 df.isn..

[스파르타 내일배움캠프]5일차 -파이썬 라이브러리

development-1 2024. 10. 4. 21:00  인공지능을 위한 파이썬 라이브러리 3-4 [完]인공지능을 위한 파이썬 라이브러리 4-2 [完]     판다스 사용을 위해 데이터 불러오기와 저장하기csv,Excel,JSON 등 다양한 형식에서 데이터 불러오기 가능 하며 , 자료는 케글에서 쉽게 다운로드 가능하다.  csv 불러오기케글을 통해 csv 파일을 다운로드 했다면 , 판다스를 불러오고 이후 df란 변수에 판다스 안에 있는 csv 불러오는 기능을 사용하면 되는데 코드는df = pd.read_csv(파일경로) 와 같다.여기서 생길수있는 문제점으로는  C:\Users\gemma\OneDrive\Desktop\sparta\csv 이런식으로 파일 경로를 탐색기에서불러와서 명령어를 입령하는데 오류..

[스파르타 내일배움캠프]4일차 -파이썬 라이브러리

인공지능을 위한 파이썬 라이브러리 1-3 [完]인공지능을 위한 파이썬 라이브러리 2-3 [完]     판다스 란 ?판다스는 파이썬에서 데이터를 쉽게 다룰수 있게 해주는 데이터 분석 라이브러리데이터를 표형식으로 다루기 쉽게 만들어주고 ,  다양한 데이터 조작 기능을 제공한다.라이브러리 보다 쉽게 이해할수 있는 예시인데 ,판다스는 표준 라이브러리가 아닌 외부라이브러리에 속한다   판다스를 어떻게 활용 할수있을까 ?데이터 분석통계분석, 트렌드파악, 데이터 시각화들 다양한 작업에 사용할수있다.데이터 전처리머신러닝 모델을 만들기 전에 , 데이터를 정리하고 변환하는 과정에서 필수.결측값 처리 , 이상치제거 , 데이터 변환등 다양한 작업 지원.비즈니스 인텔리전스고객 데이터 분석 , 판매 데이터 추적등 다양한 분석 작..