제약 분야의 모든 AI 팀이 결국 마주하게 되는 질문을 생각해 보십시오:
- 컴퓨터 시스템 밸리데이션(CSV, Computer System Validation) 엔지니어의 현재 워크플로우는 어떠한가?
- 그 워크플로우 중 AI 에이전트가 자동화할 수 있는 부분은 어디인가?
- 이를 실현하기 위해서는 어떤 아키텍처와 실행 계획이 필요한가?
독립적인 분석들 전반에서 나타나는 수렴(convergence)은 매우 놀라울 정도입니다. 하지만 이들이 공유하는 맹점(blind spots) 또한 완전히 동일합니다.
업계의 합의점 (The Consensus)
핵심 통찰은 일관됩니다: CSV 엔지니어 업무 시간의 60~70%는 엔지니어링이 아니라 단순 문서 작업(documentation drudgery)에 소모된다는 점입니다. 추적성 매트릭스(Traceability Matrix), IQ/OQ/PQ 테스트 스크립트, 밸리데이션 종합 보고서(Validation Summary Report) 등은 구조화되어 있고 템플릿 기반으로 작성되는 반복적인 산출물이며, 대규모 언어 모델(LLM)이 단 몇 초 만에 초안을 작성할 수 있습니다.
에이전트 우선순위 목록은 다음과 같습니다:
| 순위 | 에이전트 | 일치도 (Agreement) | 일반적인 ROI 기대치 |
|---|---|---|---|
| 1 | 추적성 매트릭스 에이전트 (Traceability Matrix Agent) | 5/5 | 공수 70~90% 절감 |
| 2 | 테스트 스크립트 생성기 (Test Script Generator, IQ/OQ/PQ) | 5/5 | 작성 시간 50~80% 단축 |
| 3 | 문서 초안 작성 에이전트 (Document Drafting Agent) | 4/5 | 소요 시간 40~60% 단축 |
| 4 | 변경 영향 분석 에이전트 (Change Impact Analysis Agent) | 4/5 | 평가 시간 40~70% 단축 |
| 5 | 요구사항 검토 에이전트 (Requirements Review Agent) | 3/5 | 검토 시간 60% 단축 |
아키텍처 패턴 역시 일관되게 나타납니다: RAG 지식 베이스를 기반으로 특화된 워커 에이전트(worker agent)들에게 작업을 라우팅하는 슈퍼바이저/오케스트레이터 에이전트(supervisor/orchestrator agent)가 존재하며, 어떠한 GxP 문서든 최종 확정되기 전에 반드시 인간 참여형(Human-in-the-Loop) 승인 게이트를 통과하도록 설계됩니다.
규제 프레임워크 또한 일관적입니다: 21 CFR Part 11, EU GMP Annex 11, GAMP 5, ICH Q9/Q10이 기본 전제로 제시됩니다.
타협할 수 없는 절대적인 원칙 또한 보편적입니다: AI는 초안을 작성하고, 인간이 승인합니다. 예외는 없습니다.
이견과 쟁점 (The Disagreements)
그러나 다음의 세 가지 축에서는 이러한 합의가 깨집니다: 아키텍처 철학, 도입 타임라인, 그리고 한 가지 놀라운 에이전트 제안입니다.
벡터 DB 단독 vs. 벡터 + 지식 그래프 (Vector DB alone vs. Vector + Graph)
대부분의 분석은 지식 기반의 백본으로 벡터 데이터베이스(Pinecone, Weaviate, ChromaDB 등)를 제안합니다. 하지만 오직 하나의 모델만이 Neo4j를 그래프 데이터베이스 레이어로 추가할 것을 제안하며, 이를 “CSV를 위한 비밀 무기”라고 불렀습니다.
그리고 그 모델의 판단이 옳았습니다.
추적성(Traceability)은 본질적으로 그래프 문제입니다. 요구사항 노드는 기능 명세(Functional Spec) 노드와 연결되고, 이는 다시 테스트 케이스 노드로, 그리고 테스트 결과 노드로 이어집니다. 벡터 검색은 의미론적으로 유사한 텍스트를 찾아냅니다. 반면 그래프 탐색(graph traversal)은 구조적 관계를 찾아냅니다. 둘 다 필수적입니다. 벡터 검색에만 의존해 구축된 추적성 에이전트는 언뜻 그럴듯해 보이지만 엄밀한 연결 고리(linkage)의 누락을 놓치는 매트릭스를 생성할 위험이 큽니다. 그리고 이는 바로 FDA Form 483 지적 사항에서 정확히 적발되는 결함입니다.
구현 타임라인 (Implementation Timeline)
실제 시스템을 얼마나 빨리 구축 및 배포할 수 있는가에 대해 각 모델의 의견은 크게 엇갈렸습니다:
| 모델 | 일정 | 전제 조건 및 범위 |
|---|---|---|
| 1 | 3~4개월 | 단일 에이전트, 단일 프로젝트 대상의 제한적 파일럿 |
| 2 | 6~12개월 | 시스템 연동을 포함한 단계적 롤아웃 |
| 3 | 12~18개월 | 엔터프라이즈 시스템 연동을 포함한 전체 제품군 구축 |
| 4 | 12~24개월 | 전사적 배포 및 규제 선례에 대한 규제 당국 협의 포함 |
| 5 | 단계당 3~4주 | 애자일 스프린트 기반의 점진적 배포 |
프로덕션 배포를 위한 현실적인 일정은 12~18개월입니다. 3개월 타임라인은 단일 밸리데이션 프로젝트에 단일 에이전트를 적용하는 파일럿에 적합하며, 실제로 시작해야 할 출발점이기도 합니다. 24개월 타임라인은 전사적 롤아웃과 AI 기반 밸리데이션 선례에 대한 FDA와의 사전 협의까지 포함합니다. 두 관점 모두 현실적이며, 단지 서로 다른 범위를 설명하고 있을 뿐입니다.
데이터 분석 에이전트 (The Data Analysis Agent)
한 모델은 다른 모델들이 제시하지 않은 독창적인 안을 제안했습니다. 바로 스크린샷, CSV 익스포트, 시스템 로그 등 테스트 수행 증거(test execution evidence)를 파싱하여 적격성 판정 기준(acceptance criteria)과 비교 대조하는 ’데이터 분석 에이전트(Data Analysis Agent)’입니다. 이는 아직 충분히 탐색되지 않았지만 매우 높은 가치를 지닙니다. 테스트 수행 결과 검토는 엔지니어가 수백 장의 스크린샷을 일일이 들여다보며 시스템 출력이 기대 결과와 일치하는지 확인해야 하는 지루한 수작업입니다. 컴퓨터 비전(CV)과 정형 데이터 파싱을 결합하면 이러한 비교 작업을 자동화할 수 있으며, 인간 엔지니어는 엣지 케이스 판정에만 집중할 수 있습니다.
3대 맹점 (The Blind Spots)
분석이 진정으로 흥미로워지는 지점은 바로 여기입니다. 어떠한 접근법을 취하든 독립적인 분석들은 한결같이 동일한 누락을 범하고 있습니다.
맹점 1: 푸롤레아(Purolea) 경고 서한
일반적인 AI 에이전트 설계안들은 2026년 4월 2일 자로 발행된 푸롤레아 코스메틱스 랩(Purolea Cosmetics Lab)에 대한 FDA 경고 서한(Warning Letter)을 전혀 언급하지 않습니다. 이는 의약품 CGMP 규정에서 AI 오용(misuse)을 명시적으로 지적한 FDA 최초의 법적 집행 조치(enforcement action)입니다.
해당 기업은 완제의약품 규격(specifications), 표준작업지침서(procedures), 제조 및 관리 기록서 원본(master production/control records)을 생성하는 데 AI 에이전트를 사용했습니다. 그러나 AI의 출력물은 품질 부서(Quality Unit)의 검토 없이 품질 시스템에 그대로 반영되었습니다.
FDA는 21 CFR 211.22(c), 즉 품질 부서의 책임 불이행을 위반 사항으로 적시했습니다. FDA의 입장은 명확하고 정밀합니다: GxP 문서를 생성하기 위해 AI를 사용한 것 자체가 위반인 것은 아닙니다. 자격을 갖춘 적격한 사람이 AI의 출력물을 검토하고 승인하지 않은 것이 위반인 것입니다.
이는 제약 밸리데이션용 AI 에이전트를 구축하는 모든 이들에게 가장 중요한 단일 규제 데이터 포인트입니다. 이는 이론적인 가이드라인이 아닙니다. 실제 법 집행 선례입니다. CSV AI 시스템의 모든 아키텍처 다이어그램에는 결코 우회할 수 없는 ‘인간 검토(Human Review)’ 상자가 반드시 포함되어야 하며, 푸롤레아 경고 서한이 바로 그 명확한 이유입니다.
맹점 2: ISPE GAMP AI 가이드
통상적인 AI 에이전트 설계안들은 2025년 7월에 발간된 ’ISPE GAMP 가이드: 인공지능(ISPE GAMP Guide: Artificial Intelligence)’을 참고하지 않고 있습니다. 총 290페이지에 달하는 이 문서는 GAMP 5 제2판(Second Edition)의 공식 보충 가이드로서, GxP 환경에서의 AI 밸리데이션을 위한 사실상의 표준(de facto standard)으로 자리 잡고 있습니다.
이 가이드는 전통적인 CSV가 다루지 못했던 5가지 핵심 요구사항을 제시합니다:
-
AI 특화 품질 위험 관리(AI-specific Quality Risk Management) — 일회성이 아닌 지속적인 관리여야 합니다. 드리프트 모니터링(drift monitoring) 없이 1월에 AI 시스템을 밸리데이션해 두고 12월에도 여전히 유효할 것이라고 간주해서는 안 됩니다.
-
동적 시스템 처리(Dynamic systems handling) — 사전에 명시적인 의사결정이 필요합니다. 모델을 고정(lock)하고 성능 저하를 수용할 것인지, 아니면 재학습/재적격성평가 인프라를 구축할 것인지를 결정해야 합니다. 가장 흔한 실패 패턴은 모델 적응에 대해 아무런 명시적 결정도 내리지 않은 채—공식적으로 고정하지도 않고 공식적으로 적응형으로 만들지도 않은 채—모델을 배포하는 것입니다.
-
AI 사이버 보안(AI cybersecurity) — 전통적인 IT 보안과는 완전히 구분됩니다. 데이터 오염(Data poisoning), 적대적 입력(adversarial inputs), LLM을 겨냥한 프롬프트 인젝션(prompt injection), 모델 탈취(model exfiltration) 등의 위협은 기존 GAMP 위협 모델에는 존재하지 않았던 새로운 영역입니다.
-
의료기기 내 AI 및 의료기기 소프트웨어로서의 AI(AI in and as medical device) — IEC 62304 및 ISO 14971 요구사항이 GxP 프레임워크 내로 통합되었습니다.
-
공급업체 및 서비스 제공자 적격성평가(Supplier and service-provider qualification) — 학습 데이터 출처(provenance), 편향(bias) 평가, 변경 통지 약정, 설명가능성(explainability) 산출물 등이 요구됩니다.
이 5가지 요구사항을 고려하지 않은 CSV용 AI 에이전트 아키텍처는 불완전한 기반 위에 세워진 것에 불과합니다.
맹점 3: 에이전트 밸리데이션의 재귀성 (Agent validation recursion)
어떤 모델도 다루지 못한 철학적 문제가 여기에 있습니다: 컴퓨터 시스템을 밸리데이션하기 위해 AI 에이전트를 구축한다면, 그 에이전트 자체가 밸리데이션 대상이 되는 GxP 도구가 됩니다.
이는 선택 사항이 아닙니다. ISPE GAMP AI 가이드는 명시하고 있습니다: AI 지원 컴퓨터화 시스템은 그 자체로 IQ/OQ/PQ를 거쳐야 합니다. 에이전트 플랫폼—LLM, RAG 파이프라인, 오케스트레이션 로직, 출력 스키마—모두 밸리데이션 계획서, 테스트 프로토콜, 밸리데이션 종합 보고서를 필요로 합니다.
이 문제의 재귀적(recursive) 성격이야말로 난이도를 높이는 주원인입니다. 밸리데이션을 자동화하기 위한 시스템을 만드는데, 정작 그 시스템 자체도 밸리데이션을 받아야 하는 것입니다. 이에 대한 실질적인 해결책은 플랫폼을 최초 1회 완전히 밸리데이션하고(인프라에 대한 IQ/OQ, 실제 밸리데이션 문서로 구성된 검증용 테스트 데이터셋에 대한 에이전트 정확도 OQ/PQ), 이후의 프롬프트 변경이나 모델 업데이트는 재적격성평가를 유발하는 변경 관리(change control) 이벤트로 취급하는 것입니다.
PwC가 실제 현장에서 확인한 결과
20개 이상의 글로벌 제약 고객사를 대상으로 진행된 PwC의 2025년 8월 연구는 LLM들의 합의 내용을 독립적으로 입증하는 동시에 구체적인 실증 데이터를 제시합니다. PwC는 전체 밸리데이션 라이프사이클에 걸쳐 100개 이상의 AI 활용 사례를 분석하고, 대시보드 밸리데이션 스크립트 작성을 위한 GPT 기반 솔루션을 구축했습니다.
그 결과는 초안 작성 시간 40% 단축과 비약적인 표준화 향상이었습니다. 이는 이론적인 예측이 아니라, 실제 프로덕션 도입 환경에서 측정된 결과입니다.
PwC가 도출한 세 가지 전략적 실행 요소는 LLM들이 제안한 내용과 정확히 일치합니다:
- AI 시스템 자체의 밸리데이션(Validate the AI systems themselves) — AI를 위한 표준작업지침서(SOP), 문서화 체계 및 밸리데이션 방법론 개정
- AI 기반 밸리데이션(AI-enabled validation) — 문서 작성, 위험 평가, 워크플로우 자동화를 위한 에이전트 배포
- 거버넌스 및 인력 역량 강화(Governance and workforce) — 팀 역량 재교육(upskilling), 프로세스 개정, 추적성 메커니즘 내재화
종합 통합 아키텍처 (The Synthesized Architecture)
다양한 분석에서 제시된 최고의 아이디어를 취합하고, 추가적인 규제 연구를 반영하여 보완한 종합 아키텍처는 다음과 같습니다:
┌─────────────────────────────────┐
│ CSV Engineer / User │
└──────────────┬──────────────────┘
│
┌──────────────▼──────────────────┐
│ Validation Supervisor Agent │
│ (Orchestrator — LangGraph) │
└──┬─────────┬───────────┬────────┘
│ │ │
┌────────────▼──┐ ┌────▼────────┐ ┌▼───────────────┐
│ Traceability │ │ Test Script │ │ Change Impact │
│ Matrix Agent │ │ Generator │ │ Analysis Agent │
└──────┬────────┘ └──────┬──────┘ └────────┬───────┘
│ │ │
┌──────▼─────────────────▼─────────────────▼────────┐
│ Knowledge Layer (RAG + Graph) │
│ ┌─────────────┐ ┌──────────────┐ ┌───────────┐ │
│ │ Vector DB │ │ Graph DB │ │ Template │ │
│ │ (embeddings)│ │ (Neo4j: │ │ Library │ │
│ │ │ │ URS→FS→TC) │ │ │ │
│ └─────────────┘ └──────────────┘ └───────────┘ │
└────────────────────────┬──────────────────────────┘
│
┌────────────────────────▼──────────────────────────┐
│ Deterministic Compliance Gate │
│ • Pydantic schema validation │
│ • Citation verification (anti-hallucination) │
│ • Audit trail logging (immutable, WORM) │
│ • ALCOA+ compliance check │
└────────────────────────┬──────────────────────────┘
│
┌────────────────────────▼──────────────────────────┐
│ Human-in-the-Loop Approval │
│ • Review / Edit / Accept / Reject │
│ • Electronic signature (21 CFR Part 11) │
│ • Purolea-compliant: QU must review AI output │
└────────────────────────┬──────────────────────────┘
│
┌────────────────────────▼──────────────────────────┐
│ Enterprise Integration Layer │
│ • VLMS (ValGenesis, Kneat, Veeva) │
│ • QMS (TrackWise, MasterControl) │
│ • DMS (SharePoint, Documentum) │
│ • Test Mgmt (Jira, HP ALM) │
└───────────────────────────────────────────────────┘
단계별 도입 플레이북 (The Implementation Playbook)
1단계 (1~3개월차): 단일 에이전트로 가치 입증하기 단 하나의 실제 밸리데이션 프로젝트에 추적성 매트릭스 에이전트를 우선 배포합니다. 벡터 DB와 그래프 DB를 결합하여 구성합니다. 에이전트 플랫폼 자체에 대한 적격성평가(IQ/OQ)를 수행합니다. 기존 작업 기준선(baseline) 대비 시간 절감 효과를 측정합니다. 이것이 개념 증명(PoC) 단계입니다. 사람이 작성하는 것보다 더 나은 RTM(요구사항 추적성 매트릭스)을 더 빠르게 생성해 내지 못한다면, 여기서 멈추어야 합니다.
2단계 (4~8개월차): 핵심 제품군 구축 테스트 스크립트 생성기와 변경 영향 분석 에이전트를 추가합니다. 기존 밸리데이션 수명주기 관리 시스템(VLMS)과 연동합니다. 프롬프트 템플릿과 모델 버전을 공식적인 변경 관리 대상(controlled change items)으로 취급하기 시작합니다.
3단계 (9~14개월차): 루프 완성 (Close the loop) 에이전트 간 크로스 워크플로우를 연결합니다: 변경 영향 분석이 테스트 스크립트 재생성을 트리거하고, 이것이 다시 추적성 매트릭스를 자동으로 업데이트하도록 합니다. 모델 드리프트에 대한 지속적인 모니터링 체계를 배포합니다. 규제 실사 준비를 위한 감사 대비(audit readiness) 에이전트를 구축합니다.
4단계 (15~24개월차): 전사 확장 (Scale) 글로벌 시스템 배포. 예측 분석 도입. AI 기반 밸리데이션 선례에 대해 규제 기관과 본격적인 협의를 진행합니다.
AI가 CSV에 대해 오판하고 있는 본질
앞서 살펴본 맹점들은 하나의 뚜렷한 패턴으로 수렴합니다. LLM은 기술적 아키텍처를 종합하는 데는 탁월합니다. 하지만 빠르게 변화하는 규제 집행 동향을 추적하는 데는 평범한 수준에 그칩니다. 그리고 기술을 기술 자체의 거버넌스 영역에 적용할 때 발생하는 메타 문제(meta-problems), 즉 ’재귀적 도전 과제’를 예측하는 데는 심각할 정도로 무력합니다.
본 글을 작성하는 시점을 기준으로 푸롤레아 경고 서한이 발행된 지 4개월이 지났습니다. ISPE GAMP AI 가이드가 발표된 지는 12개월이 되었습니다. FDA CSA 가이드라인이 최종 확정된 것은 10개월 전입니다. 이들은 결코 모호하거나 지엽적인 참고 자료가 아닙니다. 제약 분야에서 AI를 구축하려는 모든 실무자에게 이미 작동 중인 규제 현실입니다. 그럼에도 불구하고 독립적인 AI 분석들은 방법론을 불문하고, 자신들이 규율하고자 하는 바로 그 영역의 AI 에이전트 아키텍처를 설계할 때 이 중 단 하나도 수면 위로 끌어올리지 못했습니다.
이것이 바로 규제 전략 수립에 LLM을 활용할 때 마주하게 되는 근본적인 한계입니다. LLM은 자신이 학습한 내용을 종합할 수는 있지만, ‘지금 당장 무엇이 가장 중요한지’ 우선순위를 매길 수는 없습니다. ’기술적으로 올바른 아키텍처’와 ‘규제 당국에 방어 가능한(regulatorily defensible) 아키텍처’ 사이의 간극이야말로 인간 전문가의 통찰이 결코 대체될 수 없는 영역입니다.
생각해 보면, 이는 LLM 스스로가 CSV 엔지니어의 역할에 대해 내린 결론과도 정확히 일치합니다.
다음으로 읽어볼 만한 글 (What to read next)
상세한 소스 비교가 포함된 전체 심층 분석은 다음 연구 노트에서 확인하실 수 있습니다: [[CSV AI Agent Multi-LLM Consensus 2026]].
AI 에이전트가 CSV에서 80/20 법칙을 어떻게 뒤집을 것인가에 대한 이전 분석은 [[The CSV Inversion]]을 참고하십시오.
FDA CSA, EU GMP Annex 22, GAMP AI 가이드 등 규제 프레임워크 배경에 대한 자세한 내용은 [[CSA AI LLM GxP Research]]를 참고하십시오.
참고 자료 (Sources)
- FDA CSA Final Guidance, Sept 24, 2025 (Docket FDA-2022-D-0795)
- FDA Purolea Warning Letter, April 2, 2026 (FEI 3011669383)
- ISPE GAMP Guide: Artificial Intelligence, July 2025
- PwC: “How AI is transforming computer system validation,” Aug 2025
- ClinStacks: “GAMP 5 & the ISPE AI Guide,” 2026
- Ketryx validated AI agents product launch, 2025-2026
- ValGenesis next-gen VAL platform, INTERPHEX 2026
- Seqova: “Computerized System Validation in Pharma: 2025 Updates & 2026 Readiness”
Saram Consulting