728x90
로지스틱 회귀(Logistic Regression): 두 데이터 요인 간의 관계를 찾는 데이터 분석 기법

 

"로지스틱 회귀"는 이진 분류(binary classification) 문제를 해결하는 데에 자주 사용되는 알고리즘이다.

예를 들어, 주어진 사진이 고양이인지 아닌지를 판별하는 문제나 이메일이 스팸인지 아닌지를 판별하는 문제 등에서 사용된다.

로지스틱 회귀는 주어진 입력 데이터(예: 고양이 사진)와 그에 대한 출력값(예: 고양이인지 아닌지) 사이의 관계를 찾아내는 것이 목적이다.

입력 데이터와 가중치(weight)의 곱모두 더한 결과를 로지스틱 함수(sigmoid function)에 적용하여 0과 1 사이의 값으로 변환한다. 이 값을 확률(probability)로 해석하여, 예측하고자 하는 결과값이 1일 확률과 0일 확률을 계산한다.

이러한 계산을 통해 로지스틱 회귀는 입력 데이터와 출력값 사이의 관계를 학습하게 된다. 이렇게 학습된 모델은 새로운 입력 데이터가 주어졌을 때 해당 입력 데이터에 대한 출력값을 예측할 수 있게 된다.

 

  • Classification: K개 중 N개를 선택하는 문제
    • Binary classification: K=2, N=1                       
    • Multi class classification: K>2, N=1
    • Multi label classification: K>=2, N>1 *이 여러개
    • One class classfication: K=1, N=1 *자기 자신 여부

 

확률을 근사하는 모델을 만들기 위해 0~1의 범위로 출력해야 한다.

로지스틱 함수(= sigmoid function, 시그모이드 함수- 활성화 함수들 중 하나)를 이용하여 계산한다.

로지스틱 함수는 다음과 같은 S자 형태의 곡선을 그리며, 입력값을 0과 1사이의 값으로 변환해준다.

 

 

로지스틱 함수의 출력값이 0.8이라면 예측하고자 하는 결과값이 1일 확률이 80%, 0일 확률이 20%라는 의미이다.

 


*로지스틱 회귀는 분류 문제에서 많이 사용되지만

분류 뿐만 아니라 회귀(regression) 문제에도 적용이 가능하다.

예를 들어, 로지스틱 회귀를 사용하여 집값을 예측하는 회귀 문제를 풀 수 있다. 이 경우에는 종속 변수(dependent variable)인 집값이 연속적인 값이므로 이를 분류하는 것이 아니라 연속적인 값으로 예측해야 한다. 이를 위해서는 로지스틱 함수 대신 선형 함수(linear function)를 사용하여 예측값을 계산하고, 손실 함수(loss function)도 로지스틱 회귀에서 사용하는 이항 로그 손실 함수(binary log loss function) 대신 평균 제곱 오차(mean squared error) 등을 사용해야 한다.

따라서 로지스틱 회귀는 분류 문제 뿐만 아니라 회귀 문제에도 적용이 가능한 범용적인 모델이라고 할 수 있다. 하지만 로지스틱 회귀는 입력 변수와 종속 변수 사이에 선형적인 관계가 있다는 가정을 기반으로 하기 때문에, 비선형적인 관계가 있는 문제에는 다른 모델을 사용해야 할 수도 있다.

728x90

+ Recent posts