새로운 모델이 출시될 때마다 사람들의 관심은 늘 하나의 질문으로 수렴됩니다. 바로 “매개변수(parameter)가 몇 개인가?“입니다. 이는 2020년대의 ’클럭 속도(clock-speed) 논쟁’이라 할 수 있습니다. 한때는 유용했으나 점차 오해를 낳았고, 이제는 프로덕션 AI 시스템을 구축하는 실무자의 의사결정에 명백히 위험 요소가 된 대리 지표(proxy metric)입니다.
2조 개의 토큰으로 훈련된 700억 개(70B) 매개변수 모델과, 15조 개의 토큰으로 훈련된 700억 개 매개변수 모델은 근본적으로 전혀 다른 인공물(artifact)입니다. 두 모델은 서로 다른 스케일링 곡선 상의 서로 다른 지점을 차지합니다. 추론(reasoning) 작업, 암기(memorization) 작업, 롱 컨텍스트(long-context) 작업, 그리고 희귀 지식이 필요한 작업에서 완전히 다르게 작동합니다. 이 둘을 단순히 “70B”라는 하나의 숫자로 뭉뚱그리는 것은 정작 중요한 거의 모든 요소를 내던지는 일입니다.
칭화대 교수이자 지푸 AI(Zhipu AI)의 공동 창업자인 탕지에(Jie Tang) 교수는 최근 지난 5년간의 스케일링 법칙(scaling law) 진화를 실무자 관점에서 명쾌하게 압축한 글을 발표했습니다. 그의 주장은 명확합니다. 매개변수 자체가 지표가 아니라는 것입니다. 진정한 지표는 ’자원의 배분(allocation)’이며, 이 배분에는 둘 이상의 다이얼이 존재합니다.
그의 글은 스케일링 역사에 대한 교정서이자 제품 매니페스토이기도 합니다. 2026년 8월 14일 공개된 GLM-5.3은 이 주장을 뒷받침하는 정밀한 대조 실험(controlled experiment)의 결과물입니다. 이전 버전인 GLM-5.2와 동일한 기본 모델, 동일한 아키텍처, 동일한 총 매개변수 수, 동일한 활성 매개변수(activated parameters) 수를 유지했습니다. 오직 1개월간의 사후 훈련(post-training)만이 추가되었을 뿐이지만, 그로 인한 성능 향상은 결코 미미한 수준이 아니었습니다.
여기 그 전말을 소개합니다. AI 학계와 업계가 무엇을 오판했고, 어떻게 바로잡았으며, 현재의 프론티어가 실제로 어디에 위치해 있는지 살펴보겠습니다.
카플란의 우회로: 지수가 잘못 설정되었을 때
2020년, OpenAI의 카플란 등(Kaplan et al.)은 트랜스포머 언어 모델에 대한 최초의 체계적인 스케일링 법칙을 발표했습니다. 연구진은 매개변수 수($N$), 데이터셋 크기($D$), 연산량($C$, compute)의 함수로 손실(loss)에 대한 멱법칙(power law)을 피팅했습니다. 각 항의 지수(exponent)는 비대칭적이었습니다. 데이터보다 매개변수의 지수가 훨씬 가팔랐고, 이에 따른 실무적 권고는 명확했습니다. 연산 자원이 더 늘어나면, 대부분을 모델을 더 크게 키우는 데 쓰라는 것이었습니다.
업계는 이 레시피를 충실히 따랐습니다.
GPT-3: 1,750억(175B) 매개변수, 약 3,000억 개의 훈련 토큰. 매개변수당 약 1.7개의 토큰에 불과했습니다. 고퍼(Gopher): 2,800억(280B) 매개변수, 약 3,000억 개의 토큰. 메가트론-튜링 NLG(Megatron-Turing NLG): 5,300억(530B) 매개변수, 약 2,710억 개의 토큰 — 매개변수당 약 0.5개의 토큰이었습니다.
이 모델들은 더 많은 지식을 담을 수 있는 용량(capacity)을 가지고 있었지만, 실제로 그것을 학습할 만큼의 데이터를 공급받지 못했습니다. 선반 위에 상자가 몇 개 놓여 있지 않은 거대하고 황량한 물류창고나 다름없었습니다.
카플란 피팅의 오류는 미묘했습니다. 산출된 지수는 국소적인 범위에서는 타당했으나 외삽(extrapolation)에는 치명적으로 취약했습니다. 연산 규모를 자릿수(order of magnitude) 단위로 확장할 때, 지수의 미세한 오차는 기하급수적으로 증폭됩니다. 카플란의 비율을 더 충실히 따를수록 모델은 덜 정확해진 것이 아니라 더 심하게 잘못되었습니다. 오차가 규모 확장에 따라 희석되는 것이 아니라 누적 복리로 커졌기 때문입니다.
이후 이어진 조(trillion) 단위 매개변수 개발 열풍은, 탕 교수의 표현을 빌리자면 “업계 전체가 다 함께 발을 들였다가 결국 되돌아 나온 우회로”였습니다.
친칠라: 모든 것을 바꾼 교정
2022년, 딥마인드(DeepMind)의 호프만 등(Hoffmann et al.)은 결정적인 방법론적 차이를 두고 스케일링 실험을 다시 수행했습니다. 7,000만(70M)부터 160억(16B) 이상의 매개변수에 걸쳐 400개가 넘는 모델을 50억~5,000억 토큰으로 훈련시킨 것입니다. 연구진은 세 가지 독립적인 추정 방식 — $N$과 $D$를 변화시키는 고정 연산 예산, 등가 FLOP(isoFLOP) 곡선, 모수적 손실 피팅(parametric loss fitting) — 을 사용했습니다. 세 가지 접근법 모두 완전히 다른 답으로 수렴했습니다.
연산 최적(compute-optimal) 비율은 매개변수 편중이 아니었습니다. 대략 균형을 이루고 있었습니다. 즉, 연산량이 증가함에 따라 매개변수와 데이터가 거의 1:1 비율로 확장되는 매개변수당 약 20개의 토큰이 최적 비율이었습니다.
연구진이 피팅한 모수적 함수 형태는 다음과 같습니다.
$$L(N,D) = E + \frac{A}{N^\alpha} + \frac{B}{D^\beta}$$
결과는 놀라웠습니다. 1조 4천억 토큰으로 훈련된 700억 매개변수 모델인 친칠라(Chinchilla)는 크기가 4배 더 작고 추론 연산도 4배 적게 들었음에도 불구하고, 거의 모든 벤치마크에서 고퍼(2,800억 매개변수, 3,000억 토큰)를 압도했습니다. 그저 올바른 비율로 훈련되었을 뿐이었습니다.
매개변수당 1.7개 토큰에 불과했던 GPT-3는 극심한 과소 훈련(undertrained) 상태였던 것입니다. 동일한 연산 예산이라면 친칠라 최적 모델이 훨씬 작으면서도 훨씬 뛰어난 성능을 냈을 것입니다. 조 단위 매개변수 경쟁은 업계 전체가 수백만 달러의 비용을 치르고서야 흡수해야 했던 쓰라린 교정 과정이었습니다.
그러나 친칠라 모델에도 맹점이 있었습니다. 주된 비용이 훈련에 집중되던 시절, 즉 모델을 한 번 훈련시키고 벤치마크로 평가한 뒤 진열장에 올려두던 시절을 기준으로 최적화되었다는 점입니다. 오늘날 그 시절은 더 이상 존재하지 않습니다.
추론으로의 전환: 왜 20:1 역시 정답이 아닌가
오늘날 프론티어 모델은 하루에도 수십억 번씩 호출됩니다. 모델 수명 주기 전체의 총비용은 다음과 같습니다.
$$C_{total} = C_{train} + (C_{inference} \times N_{queries})$$
널리 배포된 모델처럼 쿼리 수($N_{queries}$)가 천문학적으로 많아지면, 전체 비용 장부에서 추론 비용이 압도적인 비중을 차지하게 됩니다. 훈련에 200만 달러가 들었지만 서빙에 연간 5,000만 달러가 드는 모델은, 훈련에 1,000만 달러가 들고 서빙에 연간 500만 달러가 드는 모델과 최적화 관점에서 근본적으로 다른 지형에 놓여 있습니다.
목적 함수에 추론 비용을 포함시키면 수학적 계산이 근본적으로 달라집니다. 최적점은 훨씬 더 오래 훈련된 더 작은 모델, 즉 의도적인 과훈련(deliberate over-training)으로 이동합니다. 훈련 단계에서 한 번 추가 비용을 지불하고, 이후 발생하는 모든 쿼리에서 영구적으로 비용을 절감하는 편이 훨씬 경제적이기 때문입니다.
경험적 증거는 이제 압도적입니다.
| 모델 | 매개변수 | 훈련 토큰 | 매개변수당 토큰 수 |
|---|---|---|---|
| GPT-3 | 175B | 300B | ~1.7 |
| Chinchilla | 70B | 1.4T | ~20 |
| Llama-2-7B | 7B | 2T | ~290 |
| Gemma-2-9B | 9B | 8T | ~889 |
| Llama 3 8B | 8B | 15T | ~1,875 |
업계는 불과 4년 만에 매개변수당 토큰 수를 1.7개에서 1,875개 수준으로 끌어올렸으며, 이는 천 배가 넘는 증가율입니다. 각 단계는 최적화의 대상이 무엇이었는가의 변화를 대변합니다. “고정된 연산량에서 훈련 손실 최소화”에서 “고정된 성능 수준에서 총소유비용(TCO) 최소화”로 전환된 것입니다.
1억 5천만(150M)부터 60억(6B) 매개변수에 이르는 47개 모델을 훈련한 연구진은 매개변수당 10,000개 토큰에 이르러서도 성능 포화의 징후를 발견하지 못했습니다. 친칠라 최적 지점을 한참 지나치더라도 데이터를 더 주입할수록 모델은 계속해서 향상됩니다. ’과훈련(over-training)’에서 ’과(over)’라는 표현은 잘못된 명명입니다. 오직 추론 비용을 도외시할 때만 과훈련이라 부를 수 있을 뿐입니다.
업계 통용 기준: 친칠라 최적은 ~20:1입니다. 추론 최적(inference-optimal)은 100:1에서 1,000:1 이상에 달합니다. 그리고 실무자들은 이론적 최적점이 아니라 배포 장치(하드웨어)에 적재 가능한 크기를 기준으로 모델 크기를 선택하는 추세입니다.
MoE가 깨뜨린 단일 숫자의 환상
업계가 추론 최적화 체제에 안착하려던 바로 그 순간, 전문가 혼합(Mixture-of-Experts, MoE) 아키텍처가 기존의 계산식을 완전히 무너뜨렸습니다. 조밀(dense) 모델에서 ’매개변수 수’는 단 하나의 숫자입니다. 하지만 MoE 모델에서는 최소한 두 개의 숫자로 나뉩니다.
총 매개변수 ($N_{total}$): 모든 전문가(expert)에 걸친 가중치의 전체 집합입니다. 이는 모델이 얼마나 많은 정보를 담을 수 있는지를 결정합니다. 즉, 지식, 사실, 세상에 대한 롱테일 정보의 저장 용량입니다. 이를 **‘도서관(Library)’**이라고 생각하면 이해하기 쉽습니다.
활성 매개변수 ($N_{active}$): 단일 토큰마다 라우팅되는 하위 매개변수 집합입니다. 이는 순전파(forward pass) 1회당 발생하는 연산량을 결정합니다. 인과적 추론의 연결 고리가 끊어지지 않고 몇 단계까지 이어질 수 있는지를 좌우합니다. 이를 **‘작업대(Workbench)’**라고 생각할 수 있습니다.
GLM-5 같은 모델은 총 매개변수가 약 7,440억 개(744B)에 달하지만, 토큰당 활성화되는 매개변수는 약 400억 개(40B)에 불과합니다. 사용자가 지불하는 연산 비용은 40B 수준이지만, 보관되는 지식의 용량은 744B에 달합니다. 추론 비용은 40B 조밀 모델과 동일하면서도 지식 수용력은 훨씬 거대한 모델 수준을 제공하는 것입니다.
이러한 분리는 심대한 결과를 낳습니다. 기존 조밀 모델의 20:1 비율이 그대로 적용되지 않는다는 점입니다. 이제 ’매개변수’라는 단어가 두 가지 서로 다른 대상을 가리키기 때문에, MoE에서는 조밀 모델과 동일한 의미를 갖는 단일 ‘매개변수당 토큰 수’ 수치 자체가 존재하지 않습니다.
작업 의존적 스케일링 법칙 (Task-Dependent Scaling Law)
로버츠 등(Roberts et al., 2025)의 연구는 이를 구체적으로 입증했습니다. 최적의 매개변수당 토큰 비율은 수행하려는 역량(skill)에 따라 달라진다는 사실을 밝혀낸 것입니다.
- 암기 작업 (Memorization tasks) (사실적 정보 회상, 지식 집약적 질의응답): 더 많은 매개변수, 즉 매개변수당 토큰 수가 더 낮은 구성에서 성능이 향상됩니다. 지식을 저장하기 위한 매개변수 공간 자체가 필요하기 때문입니다.
- 추론 작업 (Reasoning tasks) (수학적 증명, 코드 생성, 다단계 추론): 더 많은 데이터, 즉 매개변수당 토큰 수가 더 높은 구성에서 성능이 향상됩니다. 추론 패턴은 단순한 사실 정보보다 훨씬 더 많은 데이터를 필요로 합니다.
목표 작업과 스킬 구성이 일치하지 않는 검증 세트를 사용할 경우, 겉보기에 최적인 연산 최적 매개변수 수가 거의 50%나 달라질 수 있습니다. 만능의 최적점이란 존재하지 않습니다. 모델에게 어떤 작업을 시키고자 하는가에 따라 최적점이 완전히 달라집니다.
MoE의 직관에 반하는 연구 결과
가장 충격적인 발견 중 하나는 다음과 같습니다. 고정된 매개변수당 토큰 수 조건에서, 전문가를 늘려 총 매개변수를 높이는 것은 오히려 추론 성능을 저하시킬 수 있는 반면, 활성화되는 전문가 수를 늘리는 것은 추론 성능을 안정적으로 향상시킨다는 점입니다.
그 이유는 무엇일까요? 전문가 수가 많아진다는 것은 저장 공간이 늘어남을 뜻하며, 이는 지식 습득에 유리합니다. 반면 활성화되는 전문가 수가 많아진다는 것은 토큰당 연산량이 늘어남을 뜻하며, 이는 추론 능력 향상으로 직결됩니다. 전문가 수를 늘리면서도 활성화되는 전문가 수를 고정해 두면, 추론 역량은 그대로 둔 채 저장 공간만 확장하는 꼴이 됩니다. 이때 가중되는 라우팅 복잡성이 오히려 성능에 해를 끼칠 수 있습니다.
결국 “더 거대한 MoE”가 자동으로 “더 똑똑한 MoE”가 되는 것은 아니라는 의미입니다. 추가된 역량이 단순 저장이 아닌 활성화 연산에 투입되지 않는 한 말입니다.
보안 취약점을 찾는 것은 검색(Retrieval) 문제가 아니다
탕 교수는 주장을 명확히 하기 위해 구체적인 예시를 들었습니다. 이는 왜 가장 중요한 작업에서 매개변수 수가 잘못된 지표인지를 정면으로 보여줍니다.
기존에 알려진 CVE(공통 보안 취약점)를 찾아내도록 모델에 요청하는 것은 ‘검색(retrieval)’ 문제입니다. 알려진 취약점 데이터베이스를 온전히 기억하고 있는 방대한 ’도서관(총 매개변수)’을 갖춘 모델이 필요합니다. 총 매개변수를 늘리면 이 작업의 성능은 개선됩니다.
그러나 코드베이스 깊숙이 숨겨진 복잡한 논리적 결함인 새로운 제로데이(zero-day) 취약점을 찾아내는 것은 긴 호흡의 장기 추론(long-horizon reasoning) 문제입니다. 이를 해결하려면 다음과 같은 과정이 요구됩니다.
- 시스템 아키텍처의 이해
- 잠재적 공격 표면(attack surface) 식별
- 여러 파일에 걸친 신뢰할 수 없는 데이터 흐름 추적
- 다단계 익스플로잇 체인(exploit chain) 구축
- 각 단계가 이전 단계로부터 논리적으로 도출되는지 검증
- 일관성을 잃지 않고 체인을 끝까지 완수
3단계부터 6단계까지는 순수한 추론의 영역입니다. 여기에는 축적된 지식의 넓이가 아니라 토큰당 연산의 깊이가 필요합니다. 2015년부터 2024년까지의 모든 CVE를 빠짐없이 암기한 모델이라 할지라도, 20단계에 달하는 추론의 연결 고리를 끝까지 유지하지 못한다면 새로운 취약점을 결코 발견할 수 없습니다.
고급 사이버 보안 영역에서 검색 증강 생성(RAG, Retrieval-Augmented Generation)이 한계를 드러내는 이유가 바로 여기에 있습니다. LLM에 CVE 데이터베이스를 제공한다고 해서 새로운 취약점을 발견할 수 있는 것은 아닙니다. 진정한 역량은 유효 깊이(effective depth)와 추론 능력에 존재하며, 이는 바로 장기 환경(long-horizon environments)에서의 사후 훈련(post-training)이 확장하고자 하는 핵심 차원입니다.
GLM-5.3: 통제된 대조 실험
여기서부터 그의 글은 단순한 문헌 고찰을 넘어 생생한 실제 사례 연구로 전환됩니다.
GLM-5.3은 GLM-5.2와 완전히 동일한 기본 모델을 사용합니다. 동일한 아키텍처, 동일한 약 7,440억 개(744B)의 총 매개변수, 동일한 토큰당 약 400억 개(40B) 활성 매개변수, 동일한 100만(1M) 토큰 컨텍스트 창을 갖추고 있습니다. 모든 성능 향상은 단 1개월간의 사후 훈련 스케일링에서 비롯되었습니다. 더욱 다양해진 장기 환경, 강화학습 확대, 그리고 자체 개발한 SAO(Scalable Agentic Optimization)와 슬라임(slime) 비동기 강화학습 인프라의 지속적 활용이 그 원동력이었습니다.
핵심 기술 스택:
- IndexShare: 방대한 코드베이스 전반에서 일관된 추론을 유지하기 위한 롱 컨텍스트 기술
- SAO: 보상이 수백 단계에 걸쳐 주어지는 장기 작업에 최적화된 강화학습 기법
- Slime: 병렬 환경 롤아웃(rollout)을 위한 오픈소스 비동기 강화학습 인프라
- 환경 생성 파이프라인: 연구 에이전트가 실제 작업 패턴으로부터 환경을 합성하고, 심사 에이전트(judge agent)가 해결 가능성을 검증하며, 보상 해킹(reward hacking)을 방지하기 위해 참조 정답 없이 검증기(verifier)를 합성하는 자동화 파이프라인
결과는 다음과 같습니다.
| 벤치마크 | GLM-5.2 | GLM-5.3 | 변화율 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +515% |
| DeepSWE v1.1 | 46.2 | 66.9 | +45% |
| Agents’ Last Exam (CLI) | 23.8 | 28.5 | +20% |
| CyberGym | 77.2% | 84.5% | +7.3%p |
| ExploitBench | 24.4% | 54.4% | +123% |
사이버 보안 분야에서의 성능 향상은 계획되지 않았던 창발적(emergent) 현상이었습니다. Z.ai 팀은 점진적인 버그 탐지 개선을 기대하며 취약점 발견 환경을 추가했습니다. 그러나 모델은 다단계 익스플로잇 체이닝 능력을 스스로 발전시켰으며, 이는 오직 규모가 커졌을 때만 나타난 질적 도약이었습니다. 개발팀 역시 놀라움을 감추지 못했습니다. 훈련 규모가 커질수록 포화 징후 없이 성능이 복리로 누적되었기 때문입니다.
효율성 측면에서도 GLM-5.3은 유사한 작업에서 약 12만 토큰을 사용하는 Claude Opus 4.8에 비해 약 5만 개의 출력 토큰만으로 작업을 완료합니다. 더 짧은 궤적(trajectory)은 토큰당 비용을 지불하는 에이전트 워크로드에서 작업당 비용 절감을 의미합니다.
창발적인 사이버 역량의 파급력이 상당했던 탓에, Z.ai는 안전성 검토를 위해 오픈 가중치(open-weight) 공개를 약 2주간 연기했습니다. 이는 중국 AI 연구소가 창발적 역량의 위험성을 모델 출시 지연 사유로 공식 명시한 최초의 사례 중 하나입니다.
솔직한 주의사항: 위의 벤치마크 결과는 제조사 자체 보고 수치이며, 발표 시점에는 독립적인 검증을 위한 가중치가 아직 공개되지 않았습니다. Terminal-Bench의 비약적인 상승(4.6에서 28.3)은 자체 보고 편향을 감안하더라도 실질적인 효과가 남아있을 만큼 큽니다. 다만 “동일한 기본 모델, 동일한 아키텍처, 1개월의 사후 훈련으로 달성한 압도적 성능 향상”이라는 프레임은 Z.ai 측의 대조 실험 설정이며, 아직 커뮤니티 차원에서 재현 검증된 결과는 아닙니다.
다중 다이얼 프레임워크 (The Multi-Dial Framework)
탕 교수의 핵심 주장은 스케일링에 여러 개의 독립적인 다이얼이 존재한다는 점입니다.
| 다이얼 | 확보되는 가치 | 현재 상태 |
|---|---|---|
| 기본 모델 크기 (Base model size) | 지식 수용 용량 (Knowledge capacity) | 고도화 완료 |
| 사전 훈련 데이터 (Pretraining data) | 통계적 학습 (Statistical learning) | 고도화 완료 |
| 과훈련 비율 (Over-training ratio) | 추론 비용 절감 (Inference cost reduction) | 널리 도입됨 |
| 활성 연산량 / 깊이 (Active compute / depth) | 토큰당 추론 능력 (Per-token reasoning) | MoE 구조에 의존 |
| 사후 훈련 (강화학습 + 환경) | 행동 역량 (Behavioral competence) | 가장 많은 여유분(Slack) 존재 |
| 테스트 타임 연산 (Test-time compute) | 추론 시점의 추가적 논리 전개 | 급격히 발전 중 |
| 중간 훈련 (Mid-training) | 도메인 특화 (Domain specialization) | 차세대 프론티어 |
핵심 통찰은 이 다이얼들을 반드시 한꺼번에 돌릴 필요가 없다는 것입니다. 네 개의 다이얼을 고정해 둔 채 다섯 번째 다이얼만 돌려 결과를 측정한 뒤, 그 다음에 돌릴 다이얼을 결정할 수 있습니다.
“다이얼들을 함께 돌릴 필요는 없으며, 다음에 돌릴 가치가 있는 다이얼은 이전에 돌릴 가치가 있었던 다이얼과 같지 않은 경우가 대부분이다.”
이는 본질적으로 연구 자원 배분에 경사 하강법(gradient descent)을 적용한 것과 같습니다. 현재 기울기(gradient)가 가장 가파른 차원을 식별하고, 기울기가 완만해질 때까지 집중 투자한 뒤 다음 차원으로 이동하는 방식입니다.
AI 업계는 그동안 여러 차례 단일 다이얼에 대한 집착을 거쳐왔습니다.
- 2020–2021: 매개변수 (맹점: 데이터 기아)
- 2022–2023: 데이터 / 친칠라 (맹점: 추론 비용)
- 2023–2024: 과훈련 (맹점: 사후 훈련 / 강화학습)
- 2024–2025: MoE 총 매개변수 (맹점: 활성 연산량 / 작업 의존성)
- 2025–현재: 사후 훈련 환경 (맹점: 아직 미상)
각 다이얼은 단독으로만 돌렸을 때 수확 체감(diminishing returns)에 직면하지만, 그 다음 다이얼에는 종종 손쉽게 얻을 수 있는 성과(low-hanging fruit)가 기다리고 있습니다. GLM-5.3은 사전 훈련 단계에 전혀 손을 대지 않고도 풍부한 환경에서의 장기 강화학습이라는 사후 훈련만으로 프론티어급 성능 향상을 이뤄낼 수 있음을 실증한 사례입니다.
에이전트를 구축하는 실무자에게 이것이 중요한 이유
이러한 함의는 단순한 모델 벤치마크를 훌쩍 뛰어넘습니다. 코딩 에이전트, CSV(컴퓨터 시스템 밸리데이션) 에이전트, 보안 에이전트 등 프로덕션 환경의 AI 에이전트를 구축하고 있다면, 스케일링 법칙의 진화는 전체 시스템 설계에 대한 관점을 근본적으로 바꿔놓습니다.
데이터의 기본 단위가 바뀌고 있다
LLM 사전 훈련에서 데이터의 단위는 ’토큰(token)’이었습니다. 추론에서는 ’문제(problem)’가 단위가 됩니다. 에이전트 강화학습에서는 일련의 행동, 관찰, 결과로 이루어진 ’궤적(trajectory)’이 단위가 됩니다. 그리고 실제 현장의 에이전트에게는 목표 수립부터 완수까지의 전체 작업 단위인 ’에피소드(episode)’가 기본 단위가 됩니다.
이 위계 구조를 한 단계씩 올라갈 때마다 데이터에는 ’무엇이 사실인가’뿐만 아니라 **‘무엇을 해야 하는가’**에 대한 정보가 더 많이 포함됩니다. 그리고 각 단계마다 서로 다른 스케일링 전략이 요구됩니다.
궤적의 길이가 새로운 병목이다
단계별 정확도가 99%에 달하는 에이전트라 해도, 100단계에 이르는 작업을 오류 없이 완수할 확률은 $0.99^{100} \approx 36.6%$에 불과합니다. 긴 호흡의 작업에서 오차 누적은 치명적입니다. 따라서 에이전트 워크로드에서 진정으로 중요한 스케일링 질문은 “단일 단계에서 모델이 얼마나 똑똑한가?“가 아니라, **“전체 궤적에 걸쳐 얼마나 안정적으로 일관성을 유지할 수 있는가?”**입니다.
이는 ’넓이’가 아닌 ’깊이’의 문제입니다. 총 매개변수 수가 아니라 활성 매개변수, 유효 깊이, 그리고 사후 훈련에 좌우되는 역량입니다.
환경 자체가 핵심 훈련 자산이 되고 있다
과거에는 데이터가 희소한 자원이었습니다. 그러나 에이전트 시스템에서는 ‘고품질 환경(environment)’ 자체가 희소 자원으로 부상하고 있습니다. 코딩의 경우 컴파일러, 테스트 스위트, CI/CD 파이프라인이 환경입니다. 보안의 경우 취약점이 존재하는 가상 머신과 익스플로잇 검증기가 환경입니다. 규제 산업의 경우 밸리데이션된 시스템, QMS(품질관리시스템) 기록, SOP(표준작업지침서) 저장소, 테스트 증적, 일탈(deviation) 이력 등이 이에 해당합니다.
가장 뛰어난 독점 환경을 보유한 기업은 가장 거대한 모델을 보유하지 않더라도 AI 훈련에서 강력한 우위를 점할 수 있습니다. 이는 매개변수 규모와는 완전히 차원이 다른 경쟁 우위(moat)입니다.
총 매개변수 대 활성 매개변수의 관계는 에이전트 아키텍처와 직결된다
MoE에서 총 매개변수와 활성 매개변수의 구분은 멀티 에이전트 시스템 설계와 정확히 대응됩니다. 검색 레이어(BM25, 밀집 검색, 전체 코퍼스를 아우르는 총 지식 수용량)는 ’총 매개변수’의 역할을 합니다. 반면 서브에이전트의 추론 체인(맥락을 잃지 않고 유지할 수 있는 인과 논리의 단계 수)은 ’활성 매개변수’의 역할을 담당합니다.
검색된 컨텍스트가 지나치게 과도하게 주입된 서브에이전트는 논리의 흐름을 놓치기 쉽습니다. 이는 암기 편중형 MoE 구성이 추론 벤치마크에서 성능 저하를 겪는 것과 동일한 원리입니다. ’담아둘 수 있는 용량(capacity to hold)’과 ‘연결해 낼 수 있는 용량(capacity to chain)’ 사이의 근본적인 긴장 관계가 모델 계층을 넘어 시스템 아키텍처 계층에서도 그대로 재현되는 것입니다.
결론 (The Bottom Line)
새로운 모델이 출시될 때마다 누구나 묻는 질문 — “매개변수가 몇 개인가?” — 은 사실 가장 유익하지 않은 질문입니다. 진짜 던져야 할 질문은 바로 이것입니다. “어느 다이얼에 가장 많은 여유(slack)가 남아 있었으며, 개발팀이 그 다이얼을 충분히 돌렸는가?”
5년 전만 해도 다이얼은 매개변수 크기 하나뿐이었습니다. 오늘날에는 다음에 어떤 다이얼을 돌려야 할지 가장 뛰어난 직관을 가진 연구소가 승리합니다. GLM-5.3은 기본 모델을 전혀 손대지 않고도 프론티어 수준의 역량 도약을 이뤄낼 수 있음을 보여준 증거입니다. 성능 확장의 여유분은 매개변수에서 데이터로, 추론 비용으로, 사후 훈련으로 이동해 왔으며 앞으로도 계속 이동할 것입니다.
“그저 더 크게 만들기만 하면 된다”는 시대는 끝났습니다. 이제는 정밀하고 다차원적인 스케일링의 시대입니다. 그리고 희소한 자원은 매개변수에서 연산 자원으로, 그리고 마침내 ’경험(experience)’으로 서서히 이동하고 있습니다.
오늘날 AI 시스템을 구축하는 모든 이들, 특히 특화된 도메인에서 긴 호흡으로 추론해야 하는 에이전트를 개발하는 이들에게 던지는 메시지는 명확합니다. 매개변수 세기를 멈추십시오. 연산 자원이 실제로 어디에 투입되고 있는지 측정하십시오.
연구 노트: [[scaling-laws-multi-dial-era-2026]]
출처: 탕지에(Jie Tang), “Thoughts About Scaling Law” (2026년 8월). 탕 교수는 지푸 AI(Zhipu AI / Z.ai)의 공동 창업자이자 칭화대학교 교수입니다.
Saram Consulting