분류 전체보기477 Chap 10 Clustering - K-Means Clustering Supervised vs Unsupervised Learning Supervised Learning : X와 Y를 모두 알고 있는 경우 Unsupervised Learning : X만 알고 있는 경우 Clustering Clustering은 데이터 셋에서 하위 그룹이나 군집을 찾는 기술들을 의미합니다. 좋은 clustering은 그룹 내에서의 관측치는 비슷하지만 그룹들끼리는 매우 다른 것을 의미합니다. 예를 들어, n명의 유방암 환자들에게서 p 측정값을 수집한다고 하면, 데이터를 clustering 하여 다른 모르는 유형의 암을 발견할 수 있습니다. Different Clustering Methods 많고 다른 유형의 Clustering 방법들이 있습니다. 가장 많이 사용되는 두 개를 살펴보겠습니다. K.. 2019. 10. 17. Scikit-Learn(사이킷런) 코드 완벽 분석 - Linear Regression Ridge # Author: Fabian Pedregosa -- # License: BSD 3 clause 코드 소스와 저작권은 위와 같음을 밝힙니다 import numpy as np import matplotlib.pyplot as plt from sklearn import linear_model %matplotlib inline 필요한 모듈을 가져옵니다. # X is the 10x10 Hilbert matrix X = 1. / (np.arange(1, 11) + np.arange(0, 10)[:, np.newaxis]) y = np.ones(10) 힐버트 행렬을 만들어줍니다. 힐버트 행렬은 다음과 같습니다. $H_{ij} = \frac {1}{i + j - 1}$ np.arange(1, 11) np.arrang.. 2019. 10. 16. Scikit-Learn(사이킷런) 코드 완벽 분석 - Linear Regression 내장 데이터셋 # Code source: Jaques Grobler # License: BSD 3 clause 코드 소스와 저작권은 위와 같음을 밝힙니다. import matplotlib.pyplot as plt import numpy as np from sklearn import datasets, linear_model from sklearn.metrics import mean_squared_error, r2_score %matplotlib inline 필요한 모듈을 가져옵니다. # Load the diabetes dataset diabetes = datasets.load_diabetes() datasets의 당뇨병 데이터를 불러옵니다. 참고로 sklearn의 datasets은 그림1과 같습니다. 만일 다른 data.. 2019. 10. 16. Scikit-Learn(사이킷런) 소개 Scikit-Learn(사이킷런)? 파이썬으로 머신러닝을 구현할 수 있는 '실무적'인 도구입니다. Data mining과 Data analysis를 위한 간단하고 효율적인 툴을 제공합니다. 누구나 이용할 수 있고 다양한 방법으로 이용할 수 있습니다. Numpy, Scipy, matplotlib을 기반으로 합니다. 오픈 소스이지만 상업적 권리는 BSD license가 가지고 있습니다. 앞으로 사이킷런의 모든 것을 자세하게 다뤄보고 예를 통해 응용까지 할 수 있도록 학습하겠습니다. 2019. 10. 16. 이전 1 ··· 91 92 93 94 95 96 97 ··· 120 다음