본문 바로가기

전체 글477

확률변수의 평균 확률변수의 평균 확률변수 $X$의 평균(mean) 또는 $X$의 확률분포의 평균은 ($\mu_{x}$ 또는 $\mu$로 표시합니다) 여러 번 시행 시 실제로 나오는 또는 나오리라고 예측되는 $X$ 값들의 평균입니다. = ($X$의 값) X ($X$가 그 값인 상대 도수)의 합 = ($X$의 값) X ($X$가 그 값일 확률) 의 합 확률 변수 $X$의 수학적 기댓값 또는 기댓값이라고 하고 $E(X)$로 표시합니다. 동전 던지기 예 두 개의 동전을 던질 때 $X$를 각 시행해서 나오는 앞면의 수라고 합니다. 표본 공간은 $S = {HH, HT, TH, TT}$이고 $P(X = 0) = P(HH) = \frac {1}{4}$, $P(X = 1) = P(TH) + P(HT) = \frac {1}{2}$, $P.. 2019. 9. 30.
Ch05 Resampling Methods - k-fold Cross Validation k-fold Cross Validation LOOCV는 계산이 오래 걸립니다. 따라서 k-fold Cross Validation을 대신 사용합니다. k-fold Cross Validation은 데이터 셋을 k개의 다른 파트로 나눕니다 (K = 5 또는 K = 10 같은) 제일 처음의 part를 제거하고 남아있는 K-1 개의 파트에 모델을 적합시킵니다. 그러고 나서 남은 파트의 예측이 얼마나 좋은지 평가합니다(맨 처음 part의 MSE를 계산합니다.) 위의 과정을 K 번 반복합니다. 다른 part들을 각각 실행해 주면 됩니다. K개의 다른 MSE들의 평균을 구함으로써 추정 validation (test) error rate를 구합니다. $CV_{(k)} = \frac{1}{k}\sum_{i = 1}^{k}.. 2019. 9. 30.
Ch05 Resampling Methods - Leave-One-Out Cross Validation(LOOCV) LOOCV 이 방법은 Validation Set 접근법과 유사하지만 단점들을 해결하려고 시도합니다. 제시된 각 모델들에 대해 : 사이즈가 n인 data set으로 나눕니다. training data set (blue) 사이즈는 n-1이고 validation data set (beige) 사이즈는 1입니다. Training data을 사용하여 모델에 적용합니다. Validate data를 사용한 Validate model을 만든 뒤 대응하는 MSE를 계산합니다. 이 과정을 n번 반복합니다. 이 모델델의 MSE는 다음과 같이 계산됩니다. $CV_{(n)} = \frac{1}{n}\sum^{n}_{i=1}MSE_{i}$ LOOCV vs the Validation Set Approach LOOCV는 덜 편향적입.. 2019. 9. 27.
서울시 구별 병원 현황 분석 - 데이터 병합 및 그래프 분석 병원 데이터와 인구 데이터 '구별' 기준으로 병합하기 data_result = pd.merge(HOS_Seoul, pop_Seoul, on='구별') data_result.head() 병원 수 데이터와 인구수 데이터를 구를 기준으로 병합해주었습니다. 사용하지 않을 열 삭제하기 del data_result['2015년도 이전'] del data_result['2016년'] del data_result['2017년'] del data_result['2018년'] data_result.head() 사용하지 않을 연도 별 병원 수는 삭제해주겠습니다. 열 삭제 명령은 del을 사용합니다. 부분 인덱스를 설정해주기 data_result.set_index('구별', inplace=True) data_result.he.. 2019. 9. 26.