다층 퍼셉트론(MLP) 학습 알고리즘

Updated 2026-09-26 · NEXMASON ANITEX

▶ Open interactive ANITEX · equations and animations

This accessible text edition preserves the document's narrative. See the interactive edition for typeset equations, diagrams and playback.

MLP의 개요

MLP(Multi-Layer Perceptron)는 입력층, 하나 이상의 은닉층, 출력층으로 구성되는 순방향 인공신경망이다. 완전연결층에서는 앞 층의 모든 출력이 다음 층의 뉴런에 연결된다. 은닉층의 비선형 활성화 함수는 단순한 행렬 곱으로 표현할 수 없는 복잡한 함수를 학습하게 한다.

신경망 구조도

다음은 입력 3개, 은닉층 4개 및 3개, 출력 2개를 가진 MLP이다. [x=2.3cm,y=.9cm, neuron/.style=circle,draw=blue!65,fill=blue!8,minimum size=7mm, >=Stealth] in 1,...,3 (I) at (0,2-) ; in 1,...,4 (H) at (1,2.5-) ; in 1,...,3 (J) at (2,2-) ; in 1,...,2 (O) at (3,1.5-) ; in 1,...,3 in 1,...,4 (I)--(H); in 1,...,4 in 1,...,3 (H)--(J); in 1,...,3 in 1,...,2 (J)--(O); at (0,2.5) 입력층; at (1,2.5) 은닉층 1; at (2,2.5) 은닉층 2; at (3,2.5) 출력층;

뉴런의 행렬 표현

입력 벡터 x R^n_0, 가중치 W^() R^n_ n_-1, 편향 b^() R^n_라 하면 a^(0)&= x, z^()&=W^() a^(-1)+ b^(), a^()&=f^()( z^()). 여기서 =1,,L이다. 뉴런 하나의 연산은 z_j=_i w_jia_i+b_j로 나타낸다.

활성화 함수

Sigmoid(z)&=11+e^-z, &Sigmoid'(z)&=(z)(1-(z)), '(z)&=1-^2(z), &ReLU(z)&=(0,z). ReLU의 도함수는 z<0에서 0, z>0에서 1이며 z=0에서는 미분 불가능하다. 이때 구현에서는 관례적으로 부분기울기를 정한다. [width=12cm,height=6cm,grid=major,xmin=-5,xmax=5,ymin=-1.2,ymax=5.2,xlabel=z,ylabel=f(z),legend pos=north west,samples=150] 1/(1+exp(-x));Sigmoid tanh(x);tanh max(0,x);ReLU

순전파 예제

입력 x=(1,2)^T, 가중치 W=1&-1 0.5&1, 편향 b=(0, -1)^T를 가정하면 z=W x+ b=-1 1.5, a=ReLU( z)=0 1.5. 이 출력은 다음 층의 입력이 된다.

손실함수

회귀에서는 평균제곱오차를 자주 사용한다. L_ MSE=1N_i=1^N\| y_i- y_i\|_2^2. 다중 분류에서는 마지막 층의 로짓 z_k에 Softmax를 적용한다. p_k=e^z_k_j e^z_j, L_ CE=-_k y_k p_k.

역전파: 연쇄법칙의 적용

단일 샘플의 손실을 L이라 하고 ^()= L/ z^()로 정의한다. 출력층이 Softmax와 교차엔트로피의 조합이면 ^(L)= p- y. 은닉층에서는 ^()=(W^(+1))^T^(+1) f'^()( z^()) 이며, 는 원소별 곱이다. 가중치와 편향의 기울기는 L W^()&=^()( a^(-1))^T, L b^()&=^(). 미니배치에서는 샘플별 기울기를 평균한다.

경사하강법과 학습

학습률 >0에 대해 파라미터를 다음과 같이 갱신한다. W^() W^()- L W^(), b^() b^()- L b^(). 아래 그래프는 실제 학습 데이터가 아닌, 손실 감소를 설명하기 위한 예시 함수 L(t)=e^-0.08t+0.08이다. [width=12cm,height=6cm,grid=major,xlabel=학습 단계 t,ylabel=예시 손실 L(t),xmin=0,xmax=70,ymin=0,ymax=1.2,samples=150] exp(-0.08*x)+0.08;

MLP와 전자공학

MLP의 층별 행렬 곱은 다입력 다출력 선형변환과 유사하다. 비선형 활성화 함수를 추가하면 선형 시스템만으로 표현할 수 없는 관계를 모델링한다. 반도체 공정의 계측 데이터 예측, RF 회로의 특성 추정, 센서 신호의 분류, 고장 진단 등에 적용할 수 있다. 단, MLP는 이미지의 공간적 구조나 시계열의 순서를 자동으로 반영하지 않으므로 데이터와 목적에 따라 CNN 또는 시계열 모델을 고려한다.

핵심 요약

입력\ \ 행렬 연산\ \ 비선형 활성화\ \ 출력 학습은 손실함수를 정의하고 역전파로 기울기를 계산한 뒤 최적화 알고리즘으로 가중치와 편향을 반복 갱신하는 과정이다.