멀티모달 AI의 구조와 수학적 원리 인코더, 융합, 대조학습, 교차 어텐션과 생성 모델
Updated 2026-09-26 · NEXMASON ANITEX▶ Open interactive ANITEX · equations and animations
This accessible text edition preserves the document's narrative. See the interactive edition for typeset equations, diagrams and playback.
개요
멀티모달 AI는 텍스트, 이미지, 음성, 영상 등 서로 다른 형식의 데이터를 함께 처리한다. 각 모달리티의 특징을 추출하고 공통 공간에 정렬하거나 서로의 토큰을 참조하도록 결합한다. 여기서는 대표적 설계 방식들을 설명하며, 모든 모델이 동일한 구조를 사용하지는 않는다는 점에 유의한다. [H]a_wide_infographic_poster._overall_a_clean_academ.png멀티모달 AI의 주요 구성 요소를 요약한 개념도. 아래의 벡터 도식과 수식은 각 단계를 더 엄밀하게 설명한다.
전체 처리 구조
[H] [>=Latex,node distance=9mm and 9mm, every node/.style=font=, inp/.style=draw,rounded corners,minimum width=23mm,minimum height=8mm,fill=blue!9, enc/.style=draw,rounded corners,minimum width=24mm,minimum height=8mm,fill=green!10, fus/.style=draw,rounded corners,minimum width=33mm,minimum height=10mm,fill=orange!15] (t) 텍스트; (i) 이미지; (a) 음성; (v) 영상; (te) Text Encoder; (ie) Vision Encoder; (ae) Audio Encoder; (ve) Video Encoder; (f) 정렬 및 융합; (o) 분류 / 검색 / 생성; / in t/te,i/ie,a/ae,v/ve ()--(); in te,ie,ae,ve (.east)--(f.west); (f)--(o); 모달리티별 인코더와 융합 모듈을 사용하는 일반적인 예
모달리티별 입력 표현
텍스트 인코더
토큰 시퀀스 t_1,,t_L_T를 임베딩과 위치정보로 변환한다. X_T=Embed(t_1:L_T)+P_T R^L_T d.
이미지 인코더
이미지를 패치로 분할한 후 각 패치를 선형 투영한다. 패치 크기 p p, 이미지 크기 H W이면 패치 수는 N=(H/p)(W/p)이다. X_I=[x_1W_I;;x_NW_I]+P_I, W_I R^(p^2C) d.
음성과 영상 인코더
음성은 파형 또는 로그 멜 스펙트로그램으로 표현할 수 있다. 영상은 시간에 따른 프레임과 공간 패치로 표현한다. X_A=E_A(Mel(a)), X_V=E_V(v_1:T).
융합 방식
초기 융합(Early Fusion)
서로 다른 인코더 출력을 같은 차원으로 투영하고 토큰을 이어 붙인다. Z=[X_TW_T;X_IW_I;X_AW_A;X_VW_V].
교차 어텐션(Cross-Attention)
텍스트가 이미지 토큰을 참조하는 경우, Q=X_TW_Q, K=X_IW_K, V=X_IW_V로 둔다. CrossAttn(X_T,X_I)=softmax\!(QK^d_k)V. Q R^L_T d_k, K R^L_I d_k이면 어텐션 행렬의 크기는 L_T L_I이다. 각 행의 합은 1이며, 텍스트 토큰이 어떤 이미지 토큰을 참조하는지 보여준다. [H] (q) 텍스트 Q; (k) 이미지 K; (v) 이미지 V; (s) QK^/d_k; (sm) Softmax; (out) AV; (q.east)--(s.north west); (k.east)--(s.west); (s)--(sm); (sm)--(out); (v.east)-| (out.south); 텍스트 Query와 이미지 Key/Value를 사용하는 교차 어텐션
후기 융합(Late Fusion)
모달리티별 예측값을 가중 결합한다. 결측 모달리티에 대한 유연성이 있지만 초기 융합보다 세밀한 토큰 간 상호작용이 제한될 수 있다. y=_m M_m f_m(X_m), _m_m=1.
대조학습: CLIP 계열의 기본 원리
정규화된 이미지 임베딩 u_i와 텍스트 임베딩 v_j의 유사도를 계산한다. s_ij=u_i^ v_j, \|u_i\|_2=\|v_j\|_2=1. 배치 내 일치하는 이미지--문장 쌍을 양성으로 두고 양방향 교차엔트로피를 최소화한다. L_I T&=-1N_i=1^Ne^s_ii_j e^s_ij, L_T I&=-1N_i=1^Ne^s_ii_j e^s_ji, L_CLIP&=12( L_I T+ L_T I). [H] in 0,...,3 in 0,...,3==?1:0=1 (,-) rectangle ++(.92,-.92); (,-) rectangle ++(.92,-.92); (,-) rectangle ++(.92,-.92); in 0,...,3 at (+.46,.3) T_+1; at (-.35,--.46) I_+1;대조학습에서 정답 이미지--텍스트 쌍이 대각선에 위치하는 유사도 행렬의 개념도
멀티모달 생성 모델
비전 인코더가 추출한 이미지 특징을 투영하여 언어모델의 토큰과 결합할 수 있다. 자기회귀 모델의 조건부 생성 확률은 p_(y_1:M X_T,X_I)=_t=1^M p_(y_t y_<t,X_T,X_I). 정답 출력 토큰에 대한 음의 로그우도를 최소화한다. L_ gen=-_t=1^M p_(y_t^* y_<t^*,X_T,X_I).
학습 목적과 실무 고려사항
대조학습, 생성, 정렬 목적을 함께 사용할 수 있다. 단, 아래는 설계 예시이며 실제 가중치는 모델마다 다르다. L=_c L_ contrast+_g L_ gen+_a L_ align. 모달리티의 시간 동기화, 이미지 패치 수와 영상 프레임 수에 따른 계산량, 결측 입력, 데이터 편향, 잘못된 교차모달 연관, 개인정보와 저작권 문제를 검토해야 한다.
전자공학 관점의 응용
음성 스펙트로그램은 시간--주파수 해석, 영상은 2차원/3차원 신호처리, 교차 어텐션은 가중 상관 연산, 센서 융합은 상태추정과 연결된다. 센서 데이터를 추가한 경우에도 단순 연결만으로 시간 정렬과 불확실성 문제가 해결되지는 않는다.
요약
멀티모달 AI의 핵심은 서로 다른 데이터의 표현 학습, 모달리티 간 정렬, 필요한 정보의 선택적 융합, 목적에 맞는 예측 또는 생성이다. CLIP형 대조학습과 교차 어텐션 기반 생성 모델은 대표적이지만 상호 배타적이지 않다.