딥러닝에서 활성 함수(Activation Function)가 반드시 비선형(Non-linear) 이라는 것은 신경망의 근본적인 원리와 직결되는 매우 중요한 포인트. 만약 활성 함수로 선형(Linear) 함수를 사용한다면 다음과 같은 결정적인 문제들이 있다.
| 특성 | 선형(Linear) 활성 함수 | 비선형(Non-linear) 활성 함수 |
|---|---|---|
| 대표 예시 | f(x)=ax+b | ReLU, Sigmoid, Tanh |
| 층의 중첩 | 여러 층이 하나로 합쳐짐 | 층이 쌓일수록 표현력이 기하급수적으로 증가 |
| 학습 능력 | 단순 선형 회귀 수준 | 복잡한 고차원 특징 학습 가능 |
1. 층을 쌓는 의미가 사라진다. (Collapsing Layers)
수학적으로 선형함수를 여러 번 중첩하면, 결국 또 다른 하나의 선형 함수로 변환될 뿐이다.
활성 함수가 일 때 2개의 층을 통과시키면:
결국 이라는 새로운 상수를 가진 하나의 층과 기능이 동일하다.
따라서 층을 100층, 1000층 쌓아도 결국 단층 신경망(Perceptron) 과 똑같은 계산 능력만을 가지게 되어, 딥러닝의 핵심인 ‘깊은 구조’를 활용할 수 없음.
2. 복잡한 문제를 풀 수 없음
세상의 대부분의 데이터(이미지, 음성, 자연어 등)는 직선 (선형) 하나로 분류할 수 없는 매우 복잡한 경계를 가진다.
비선형 활성 함수는 공간을 왜곡하고 접음으로써, 직선으로는 해결할 수 없는 복잡한 패턴(예: XOR 문제)을 학습할 수 있게 한다.
a. 예외적인 경우 (선형 활성 함수를 쓰는 곳)
드물게 선형 함수를 사용하는 곳이 있는데, 주로 출력층(Output Layer) 에서 사용.
회귀 분석(Regression): 주가 예측이나 기온 예측처럼 출력값이 특정한 범위에 갇히지 않고 연속적인 수치여야 할 때는 출력층에 한해서 활성 함수를 생략하거나 선형 함수()를 사용한다.