최근 상위 20위권 글로벌 바이오제약 회사의 품질 부문 부사장(VP of Quality)이 여러 전문가 분석팀에 동일한 질문을 던졌습니다. 우리 GxP 환경에 지속 학습(continual learning)을 수행하는 AI 에이전트를 배포할 수 있는가?
모든 분석은 동일한 결론을 내렸습니다. 가능하지만, 사전에 승인된 엄격한 거버넌스 하에서만 허용된다는 것입니다. 모든 분석이 동일한 규제 프레임워크인 FDA PCCP, 21 CFR Part 11, EU GMP Annex 22를 인용했습니다. 모든 분석이 RAG를 결합한 고정 모델(locked model), 섀도우 배포(shadow deployment), 버전 관리 스냅샷과 같은 동일한 아키텍처 패턴을 설명했습니다.
핵심 결론은 옳습니다. 하지만 이를 뒷받침하는 주장들을 1차 출처(primary sources)와 대조해 보면 사뭇 다른 그림이 드러납니다. 발표 일자, 문서 명칭, 승인된 기기 수 등 가장 구체적인 규제 인용 중 일부가 틀렸거나 오해의 소지가 있습니다. 아키텍처 자체는 견고하지만, 이를 받치고 있는 몇몇 초석은 모래 위에 지어진 상태입니다.
증거가 실제로 뒷받침하는 내용이 무엇인지, 널리 퍼진 주장들이 어디서 왜곡되었는지, 그리고 규제 대상 바이오제약 환경에서 지속 학습 AI를 배포하기 위해 바로잡은 프레임워크를 아래에서 살펴봅니다.
모두가 정확히 짚어낸 핵심적인 역설
바이오제약 규제는 **통제(control), 예측 가능성(predictability), 재현성(reproducibility)**이라는 세 가지 기둥 위에 세워져 있습니다. 공식적인 변경 관리(change control) 주기 없이 시스템의 출력이 화요일에서 수요일로 넘어가며 임의로 바뀔 수 있다면, 그 시스템은 GxP 하에서 밸리데이션된 것으로 간주될 수 없습니다.
지속 학습은 이 세 가지 기둥을 모두 무너뜨립니다. 프로덕션 환경에서 가중치(weights)를 자율적으로 업데이트하는 에이전트는 정의상 통제되지 않은 시스템(uncontrolled system)입니다. 에이전트가 그 사이에 무언가를 학습했다는 이유로 월요일에 내린 결정과 금요일에 내린 결정이 달라진다면, 감사관은 당시의 정확한 의사결정 상태를 재현할 수 없습니다. 이는 데이터 무결성의 근간인 ALCOA+ 원칙을 근본적으로 위배합니다.
이러한 긴장 관계는 실재하며, 신뢰할 만한 모든 분석이 일치하여 지적하는 부분입니다. 21 CFR Part 11(1997년), GAMP 5 제2판(2022년), 그리고 새로운 ISPE GAMP 가이드: 인공지능(2025년 7월) 등의 규제 프레임워크는 모두 밸리데이션된 시스템이 곧 안정적인(stable) 시스템이라는 점을 전제로 합니다.
기존 분석들이 올바르게 파악한 점
증거를 통해 도출되는 3단계 수용 가능성 모델은 아키텍처 관점에서 매우 견고합니다:
RISK LEVEL APPROACH STATUS
─────────────────────────────────────────────────────────────
Low Risk Locked model + RAG Highly Acceptable
(knowledge updates only) No change control needed
Medium Risk PCCP-governed retraining Acceptable under FDA
(offline, version-controlled) Pre-authorized pathway
High Risk Autonomous in-production Unacceptable
weight updates Violates GxP principles
─────────────────────────────────────────────────────────────
실제로 작동하는 아키텍처 패턴은 이미 확립되어 있습니다:
-
RAG를 통한 인컨텍스트 학습(In-Context Learning via RAG) — 모델 자체는 고정된 상태를 유지합니다. “학습”은 전적으로 업데이트된 검색 소스(벡터 스토어에 새로 인제스트된 최신 SOP, 새로운 임상 가이드라인, 개정된 템플릿 등)를 통해서만 일어납니다. 에이전트는 마치 지속적으로 학습하는 것처럼 동작하지만, 핵심 처리 로직은 결정론적이며 검증 가능한 상태로 유지됩니다.
-
섀도우 배포(Shadow Deployment) — 새로운 모델 버전이 프로덕션 환경과 병렬로 실행됩니다. 신규 모델의 예측 결과는 로그로 기록되어 밸리데이션된 버전과 비교 검증됩니다. 공식적으로 승격(promotion)되기 전까지는 프로덕션에 아무런 영향을 미치지 않습니다.
-
스냅샷 버전 관리(Snapshot Versioning) — 변경 관리를 통해 공식 승격되는 불변(immutable)의 모델 버전을 관리합니다. 감사에서 11월에 운영되던 로직이 무엇이었는지 묻는다면, 당시 동결되었던 정확한 모델을 꺼내 보여줄 수 있습니다.
-
자동 서킷 브레이커(Automated Circuit Breakers) — 학습 업데이트로 인해 사전에 정의된 임계값을 초과하는 출력 드리프트(drift)가 발생하면, 시스템이 마지막으로 밸리데이션된 버전으로 자동 롤백됩니다.
이러한 패턴들은 가상의 개념이 아닙니다. 오늘날 제약 제조, 임상시험 운영, 규제 문서 처리 분야에서 실제로 배포되어 사용되고 있습니다.
기존 분석들이 잘못 파악한 점
“PCCP를 통해 50개 이상의 AI 지원 의료기기가 승인되었다” — 심각하게 과소평가된 수치
실제 FDA 승인을 받은 AI/ML 지원 의료기기의 수는 2025년 5월 기준 1,247개 이상, 2026년 기준 1,357개 이상에 달합니다. PCCP 최종 가이던스가 2024년 12월 4일에야 발표되었기 때문에 PCCP 경로를 명시적으로 따른 기기 수는 더 적지만, “50개 이상”이라는 표현은 FDA 규제 대상 기기에서 AI가 차지하는 규모를 극적으로 과소평가한 것입니다. 2025년 한 해에만 295개의 AI/ML 기기가 허가를 받았습니다.
“EU GMP Annex 22는 지속 학습을 명시적으로 금지한다” — 지나친 단순화
EU GMP Annex 22(유럽 위원회와 PIC/S가 2025년 7월 7일 의견 수렴을 위해 발표한 초안)는 모든 곳에서 지속 학습을 일률적으로 금지하는 것이 아닙니다. 이 문서는 **위험 기반의 차등(risk-based distinction)**을 둡니다:
- 중대한 GMP 애플리케이션(Critical GMP applications)(환자 안전, 제품 품질 또는 데이터 무결성에 영향을 미치는 영역): 정적이고 결정론적인 모델을 요구합니다. 초안의 문구를 그대로 인용하면 다음과 같습니다: “사용 중에 지속적이고 자동으로 학습하여 성능을 조정하는 동적 모델의 사용은 본 문서에서 다루지 않으며, 중대한 GMP 애플리케이션에 사용해서는 안 된다(The use of dynamic models which continuously and automatically learn and adapt performance during use, is not covered by this document, and should not be used in critical GMP applications).”
- 비중대 애플리케이션(Non-critical applications): 생성형 AI와 동적 모델의 사용이 허용되지만, 의무적인 인간 감독(human supervision)이 수반되어야 합니다.
실질적인 영향은 매우 제한적이지만, 이를 전면 금지라고 부르는 것은 프레임워크를 왜곡하고 비중대 경로의 존재를 무시하는 것입니다.
“FDA가 2024년 말 PCCP를 확정하고 2025년에 업데이트했다” — 서로 다른 문서의 혼동
PCCP 최종 가이던스는 2024년 12월 4일에 발표되었습니다(89 FR 96259, Docket FDA-2022-D-2628). PCCP 자체에 대한 2025년 업데이트는 없었습니다. 여러 분석에서 언급하는 2025년 1월 문서는 완전히 별개의 가이던스 초안인 “의약품 및 생물학적 제제의 규제 의사결정 지원을 위한 인공지능 사용 고려사항(Considerations for the Use of Artificial Intelligence to Support Regulatory Decision-Making for Drug and Biological Products)”(2025년 1월 7일)입니다. 이 문서는 의료기기가 아닌 의약품 및 생물학적 제제를 구체적으로 다루며, PCCP의 개정판이 아닙니다.
“FDA의 AI 규제 샌드박스” — 근거 없는 주장
2026년 7월 기준으로 AI를 위해 특별히 마련된 FDA “규제 샌드박스(regulatory sandbox)” 프로그램은 존재하지 않습니다. FDA는 사전 제출(Q-Sub) 프로그램과 파일럿 이니셔티브를 운영하고 있지만, 공식적인 샌드박스는 없습니다. 이 주장은 날조되었거나 영국 MHRA의 샌드박스 프로그램과 혼동한 것으로 보입니다.
“AI 실패의 78%는 조용한 실패(Silent Failure)이다” — 잘못된 출처 인용
이 통계는 제약 시스템이 아니라 인간-AI 챗봇 상호작용에 관한 2026년 연구(arXiv:2603.15423)에서 비롯된 것입니다. 이는 한 벤처 캐피털의 인프라 보고서를 통해 널리 퍼졌습니다. 일반적인 챗봇의 오류율을 GxP 환경에 그대로 적용하는 것은 범주 오류(category error)입니다.
검증된 규제 스택
규제 당국이 실제로 요구하는 사항을 확인된 발표 날짜와 함께 정리하면 다음과 같습니다:
| 프레임워크 | 발표 시점 | 실제 규정 내용 |
|---|---|---|
| 21 CFR Part 11 | 1997년 (2003년 재해석) | §11.10(e): 안전하고 컴퓨터로 생성된 시간 기록 감사 추적. §11.10(d): 인가된 개인으로 시스템 접근 제한 |
| EU Annex 11 | 시행 중 | 컴퓨터화 시스템 밸리데이션, 감사 추적, 접근 통제 |
| FDA CSA 가이던스 | 2023년 9월 | 위험 기반 보증(Risk-based assurance); 모든 출력이 아닌 안전장치(guardrails) 테스트 |
| EMA AI 반영 보고서 (Reflection Paper) | 2024년 9월 | 의약품 개발에서 AI를 위한 투명성, 데이터 품질, 수명주기 관리 |
| GAMP 5 제2판 | 2022년 | AI/ML을 위한 부록 D11; 위험 기반 수명주기 밸리데이션 |
| FDA PCCP 최종 가이던스 | 2024년 12월 4일 | AI 지원 의료기기 소프트웨어를 위한 사전 승인된 변경 관리 (89 FR 96259) |
| FDA 가이던스 초안: 의약품/생물학적 제제 AI | 2025년 1월 7일 | 의약품 개발에서 AI에 관한 최초의 FDA 가이던스; 지속 학습에 대한 공백 인정 |
| ISPE GAMP 가이드: AI | 2025년 7월 (290페이지) | GxP 시스템을 위한 AI 전용 종합 밸리데이션 프레임워크 |
| EU GMP Annex 22 (초안) | 2025년 7월 7일 | 중대 GMP에는 정적 모델 필수; 비중대 AI는 인간 감독 하에 허용 |
| FDA-EMA 공동 원칙 | 2026년 1월 14일 | 의약품 개발에서 우수 AI 관행을 위한 10대 기본 원칙 (비구속적) |
핵심적인 통찰은 이것입니다. 어떤 규제 기관도 프로덕션 환경에서의 자율적 지속 학습을 구체적으로 다루는 가이던스를 발표한 적이 없습니다. PCCP 프레임워크가 가장 근접하지만(사전에 정의된 모델 변경 범위를 미리 승인함), 이조차도 실시간 가중치 업데이트가 아닌 오프라인 재학습 파이프라인을 전제로 합니다.
바로잡은 아키텍처
오늘날 지속 학습 AI 에이전트를 배포하려는 바이오제약 기업을 위한 검증된 아키텍처는 다음과 같습니다:
┌──────────────────────────────────────────────────────────────┐
│ PRODUCTION ENVIRONMENT │
│ │
│ ┌──────────────┐ ┌──────────────┐ ┌──────────────┐ │
│ │ Locked LLM │◄───│ RAG Layer │◄───│ Versioned │ │
│ │ (weights │ │ (vector DB │ │ Document │ │
│ │ frozen) │ │ + retriever │ │ Store │ │
│ └──────┬───────┘ └──────────────┘ └──────────────┘ │
│ │ │
│ ▼ │
│ ┌──────────────┐ ┌──────────────┐ │
│ │ Gateway / │───▶│ Audit Trail │ │
│ │ HITL Review │ │ (WORM, 7yr) │ │
│ └──────────────┘ └──────────────┘ │
└──────────────────────────────────────────────────────────────┘
┌──────────────────────────────────────────────────────────────┐
│ SHADOW / STAGING ENVIRONMENT │
│ │
│ ┌──────────────┐ ┌──────────────┐ ┌──────────────┐ │
│ │ Candidate │◄───│ Curated │◄───│ Data │ │
│ │ Model vN+1 │ │ Training │ │ Pipeline │ │
│ │ (learning) │ │ Set │ │ (ALCOA+) │ │
│ └──────┬───────┘ └──────────────┘ └──────────────┘ │
│ │ │
│ ▼ │
│ ┌──────────────┐ ┌──────────────┐ │
│ │ Regression │───▶│ Change │ │
│ │ Testing │ │ Control │ │
│ │ (golden set)│ │ Approval │ │
│ └──────────────┘ └──────────────┘ │
└──────────────────────────────────────────────────────────────┘
계층 1: 고정 프로덕션 모델 + RAG
프로덕션 환경의 에이전트는 동결된 가중치를 가집니다. 모든 “학습”은 검색 계층(업데이트된 SOP, 새로운 임상 가이드라인, 최신 규제 템플릿)을 통해서만 발생합니다. 이는 가장 안전한 패턴이며 PCCP 없이 오늘날 바로 작동할 수 있는 유일한 방식입니다.
계층 2: 게이트웨이 및 휴먼 인 더 루프(HITL)
GxP 의사결정에 관여하는 모든 에이전트 출력은 RBAC(역할 기반 접근 제어)을 강제하고, 전체 상호작용을 불변의 감사 추적에 기록하며, 고위험 출력을 인간의 검토로 라우팅하는 게이트웨이를 거칩니다. 이는 GxP 환경의 모든 AI 시스템에서 결코 타협할 수 없는 요건입니다.
계층 3: 섀도우 재학습 파이프라인
분리된 격리 환경에서, 모델의 병렬 인스턴스가 큐레이션 및 검증을 거친 새로운 데이터를 바탕으로 학습합니다. 후보 모델은 “골든(golden)” 홀드아웃 데이터셋을 대상으로 자동화된 회귀 테스트를 거칩니다. 사전 승인된 수용 기준을 통과하면 공식 변경 관리를 통해 프로덕션으로 승격됩니다.
계층 4: 드리프트 모니터링 및 자동 롤백
성능 모니터링 시스템은 프로덕션 모델의 출력을 밸리데이션된 기준선(baseline)과 비교합니다. 드리프트가 사전에 정의된 임계값을 초과하면 시스템은 마지막으로 밸리데이션된 버전으로 자동 복구됩니다. 이는 잘못된 학습 업데이트가 환자 안전에 영향을 미치는 것을 방지하는 서킷 브레이커 역할을 합니다.
아무도 해결하지 못한 공백
솔직히 들여다보면 실제 규제와 기술에는 다음과 같은 현실적인 공백이 존재합니다:
- 진정한 의미의 지속 학습 시스템을 밸리데이션하는 방법에 대해 어떤 규제 기관도 가이던스를 발표하지 않았습니다. PCCP 프레임워크조차 실시간 적응이 아닌 주기적인 재학습을 전제로 합니다.
- 적응 후의 설명 가능성(Explainability) 문제는 아직 해결되지 않았습니다. 모델이 밸리데이션된 상태에서 벗어나 드리프트되었다면, 특정 결정을 내린 이유를 문서화하는 것은 거의 불가능해집니다.
- 안전이 중요한(safety-critical) 환경에서의 치명적 망각(Catastrophic Forgetting) 문제에 대해 상용 수준의 해결책이 없습니다. 연구 프레임워크는 존재하지만, 규제 기관의 밸리데이션을 통과한 사례는 없습니다.
- 학습 이벤트에 대한 ALCOA+ 데이터 무결성 — 어떤 데이터가 업데이트를 촉발했는지, 언제 발생했는지, 그 결과 도출된 모델 버전이 무엇인지 추적하는 일 — 은 대부분의 바이오제약 기업이 아직 구축하지 못한 수준의 인프라를 요구합니다.
- EU에는 PCCP에 상응하는 제도가 없습니다. 현행 EU GMP Annex 22 가이던스 초안에 따르면, 미국 FDA PCCP 하에서 배포될 수 있는 적응형 AI 시스템이라 할지라도 EU에서는 중대한 GMP 애플리케이션에 적용하는 것이 불가능할 가능성이 높습니다.
결론
바이오제약 분야의 지속 학습에 대한 업계의 합의는 방향성 면에서는 맞습니다. 조건부로 수용 가능하며, 사전 승인된 변경 관리에 의해 경계가 정해지고, 아키텍처상 프로덕션 환경에서는 RAG 기반의 지식 업데이트로, 스테이징 환경에서는 오프라인 재학습으로 제한되어야 합니다.
그러나 규제에 관한 세부 사항은 대단히 중요합니다. PCCP 프레임워크는 실재하며(“2024년 말/2025년 업데이트”가 아닌 2024년 12월 제정), 승인된 기기 시장은 거대하며(“50개 이상”이 아닌 1,357개 이상의 승인 기기), EU의 입장은 전면 금지보다 훨씬 더 정교합니다. 오늘 이 시스템을 구축하고 있다면, 가장 안전한 선택은 프로덕션 환경에서는 RAG를 결합한 고정 모델을 운영하고, 스테이징 환경에서는 PCCP 거버넌스를 따르는 재학습 파이프라인을 두며, 여러분의 구체적인 사용 사례가 어느 위험 등급에 해당하는지에 대해 규제 관련 부서(Regulatory Affairs)와 조기에 논의를 시작하는 것입니다.
규제 기관은 AI 자체를 반대하는 것이 아닙니다. 그들이 반대하는 것은 **통제되지 않은 변경(uncontrolled change)**입니다. 그 차이를 중심으로 아키텍처를 설계한다면, 실제로 작동하면서도 실사를 확실하게 통과할 수 있는 적응형 AI를 배포할 수 있을 것입니다.
연구 노트: [[Continual-Learning-AI-Agents-Biopharma-Regulated-Industry-2026|1차 출처를 바탕으로 팩트체크된 전체 분석]]
Saram Consulting