Transformer의 비용은 버그가 아니라 설계 철학이다
Self-Attention은 모든 토큰이 다른 모든 토큰과 상호작용하기 때문에 강력하지만, 입력 길이가 n일 때 계산량이 대략 O(n²)로 늘어난다. 게다가 매번 새 단어를 만들 때마다 지금까지 나온 모든 토큰의 Key·Value(KV cache)를 다시 참고해야 해서, 문장이 길어질수록 메모리 사용량도 함께 늘어난다. 이는 버그가 아니라 “아무 정보도 버리지 않겠다”는 설계 선택이 치르는 대가다.
왜 다시 RNN을 보는가
RNN은 정반대의 선택을 한다. 과거 전체를 원본 그대로 들고 있는 대신, 고정 크기의 Hidden State 하나로 압축해 다음 시점에 넘긴다. 그래서 토큰 하나를 생성하는 비용이 O(1)로 일정하고 메모리도 입력 길이와 무관하게 고정이다 — 그 대신 압축 과정에서 오래된 정보가 덮어써지며 사라질 수 있다는 대가를 치른다.
구분 | Transformer | RNN |
|---|---|---|
과거 처리 방식 | 원본 KV를 전부 보존(무압축) | 단일 고정 상태로 압축 |
토큰당 생성 비용 | O(L) — 매번 전체를 다시 참조 | O(1) — 고정 상태만 참조 |
메모리 | 길이에 비례해 계속 누적 | 길이와 무관하게 고정 |
정보 조회 정확도 | 최대 — 원본을 그대로 꺼낼 수 있음 | 손상 — 압축 과정에서 복원 불가능한 손실 발생 |
치르는 대가 | 비용과 메모리 전부 | 정보 손실 |
그래서 최근 연구는 “RNN으로 돌아가자”가 아니라, RNN의 효율이라는 장점만 떼어내 Transformer가 치렀던 단점 없이 가져오려는 방향으로 움직이고 있다. S4·RetNet·Mamba·DeltaNet 같은 Linear Recurrent Model 계열이 이 흐름에 속한다 — 회의록에 비유하면, 발언이 나올 때마다 전체를 새로 쓰지 않고 달라진 부분(변화분, Delta)만 반영하면서도, 구간(Chunk)별로는 병렬로 처리해 속도를 확보하는 방식이다.
MoE: 모든 전문가가 아니라 필요한 전문가만
Transformer가 비용 문제를 “계산 방식”에서 풀려 했다면, MoE(Mixture of Experts)는 다른 축에서 접근한다 — 모델 파라미터(전문가 수)는 늘리되, 토큰 하나를 처리할 때 실제로 계산에 참여하는 파라미터는 일부(Sparse)로 제한하는 것이다.
토큰 하나가 전문가를 거쳐 나오기까지
MoE는 대개 Transformer 블록의 Attention을 그대로 두고, 각 토큰에 독립적으로 작용하는 FFN(Feed-Forward Network)을 여러 전문가로 바꾸는 구조다. 라우터는 토큰 표현 에 대해 전문가별 점수를 구하고, 가장 큰 개만 선택한다.
Router: 토큰을 보고 모든 전문가의 적합도 점수를 계산한다.
Top-K gate: 점수가 가장 큰 전문가 k개만 남겨 계산량을 제한한다.
Experts: 선택된 FFN들이 각자 토큰을 변환한다. 전문가는 사람이 미리 지정한 주제가 아니라 학습 과정에서 다른 패턴에 특화된다.
Weighted sum: 선택된 전문가 출력을 라우터 가중치로 합쳐 다음 층에 전달한다.
전체 파라미터가 크다고 추론 메모리까지 작아지는 않는다. 활성 파라미터는 적어도 모든 전문가 가중치를 GPU 메모리에 보관해야 하며, 전문가가 서로 다른 장치에 있으면 토큰을 보내고 받는 all-to-all 통신 비용도 생긴다.
구분 | Sparsely-Gated MoE (2017) | Switch Transformer (2021) |
|---|---|---|
목적 | 대규모 딥러닝에 Sparse MoE를 정립 — 여러 전문가 중 일부만 쓰자 | 실전에 쓰기 좋게 단순화 — 더 빠르고 크게 확장하자 |
전문가 선택 방식 | 토큰마다 Top-2 전문가 선택 | 토큰마다 Top-1 전문가만 선택(단일 라우팅) |
장점 | 전문가마다 다른 패턴을 학습해 표현력 향상 | 통신 비용이 크게 줄어 1조 파라미터급 모델까지 확장 가능 |
단점 | 전문가 간 통신(라우팅) 비용이 대규모에서 비효율적 | 특정 전문가에 부하가 쏠리는 라우팅 불균형 위험 |
성공의 핵심은 전문가 수가 아니라 라우팅 균형이다
라우터가 일부 전문가만 반복해 선택하면 나머지는 학습 신호를 받지 못하는 routing collapse가 생긴다. 반대로 균등 사용만 지나치게 강제하면 비슷한 토큰이 다른 전문가로 흩어져 특화가 약해질 수 있다. 따라서 MoE 학습은 특화와 균형을 동시에 맞추는 문제다.
Load-balancing loss: 전문가별 토큰 비율과 평균 라우터 확률을 균등하게 유도하지만, 본 학습 목표와 충돌할 수 있다.
Capacity factor: 전문가 하나가 받을 수 있는 토큰 수를 제한한다. 너무 작으면 넘친 토큰이 드롭되고, 너무 크면 메모리와 연산 여유분을 낭비한다.
Shared experts: 공통 지식은 항상 켜진 전문가가 담고, routed experts는 세부 패턴에 집중하게 해 중복을 줄인다.
Fine-grained experts: 큰 FFN 몇 개를 작은 전문가 여러 개로 나누면 토큰마다 더 유연한 전문가 조합을 만들 수 있다.
이후 GShard(분산 학습), GLaM(계산·에너지 효율 개선) 등을 거쳐, Mistral 8×7B(2023, 오픈소스 MoE 상용화), DeepSeekMoE(2024), Qwen3-Next(2025, 하이브리드 Attention+MoE)까지 MoE는 대형 언어모델의 표준 확장 전략 중 하나로 자리 잡았다.
Kimi Linear: 효율과 정확도를 함께 잡으려는 최신 시도
2025년 10월 Moonshot AI가 공개한 Kimi Linear는 앞서 본 두 흐름(선형 순환 모델의 효율, MoE의 확장성)을 한 아키텍처에 결합한 하이브리드 모델이다. 총 480억 파라미터 중 실제로 활성화되는 것은 30억 개뿐이다.
KDA (Kimi Delta Attention) — DeltaNet 계열의 선형 어텐션을 확장해, 변화분(Delta)만 계산하는 방식으로 속도와 메모리를 크게 아낀다.
MLA (Multi-head Latent Attention) — 전체 문맥을 놓치지 않도록, KV를 압축된 요약본으로 보관하면서도 필요하면 전체 관계를 참고하는 Full Attention 계열 보강 장치다.
MoE — Feed-Forward 층 대신 MoE를 써서, 공통으로 항상 작동하는 Shared 전문가와 토큰별로 선택되는 Routed 전문가를 함께 둔다.
실험적으로 KDA와 MLA를 3:1 비율(KDA 3개 층마다 MLA 1개 층)로 섞었을 때 속도·메모리·정확도의 균형이 가장 좋았다고 보고됐다. 공개된 결과에 따르면 Kimi Linear는 KV cache 사용량을 최대 75%까지 줄이면서도, 일부 평가에서 Full Attention 방식보다 나은 성능을 보였다.
정리
Transformer 이후의 아키텍처 경쟁은 “더 큰 모델”만이 아니라 “같은 성능을 얼마나 적은 비용으로 내는가”로 무게중심이 옮겨가고 있다. RNN 계열은 정확도를 일부 내주고 고정 비용을 얻었고, MoE는 파라미터는 늘리되 실제 연산량은 억제했다. Kimi Linear 같은 최신 하이브리드 아키텍처는 이 둘을 조합해, 긴 문맥에서도 속도와 메모리는 가볍게, 품질은 Full Attention 수준으로 유지하려는 방향으로 나아가고 있다. 이 시리즈에서 다룬 CNN·RNN·LSTM·Transformer·BERT는 모두 이런 최신 아키텍처들이 서 있는 토대다.
참고 자료
Attention Is All You Need — Vaswani et al. (2017) — Transformer의 O(n²) Self-Attention 구조 (2026-08-07 확인)
Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer — Shazeer et al. (ICLR 2017) — MoE를 딥러닝에 정립한 원 논문 (2026-08-07 확인)
Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity — Fedus, Zoph, Shazeer (2021) — Top-1 라우팅으로 단순화한 Switch Transformer 원 논문 (2026-08-07 확인)
Kimi Linear: An Expressive, Efficient Attention Architecture — Moonshot AI (2025) — KDA·MLA 하이브리드 구조와 3:1 비율, KV cache 절감 결과 (2026-08-07 확인)
DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models — fine-grained experts와 shared experts 설계 (2026-08-10 확인)
Global-batch load balance for MoE training — Qwen Team — 라우팅 부하 균형 손실과 전문가 특화 (2026-08-10 확인)
댓글 0
댓글을 불러오는 중…