2026년 4월 2일, FDA는 미시간주 리보니아(Livonia)에 위치한 퓨롤레아 코스메틱스 랩(Purolea Cosmetics Lab)에 경고 서한(Warning Letter #722591)을 발행했습니다. 곤충 발견, 오염 위험, 작업 분리 미흡 등 일상적인 정기 실사에서 흔히 볼 수 있는 통상적인 지적 사항들이었습니다. 하지만 그중 한 가지 지적 사항은 결코 평범하지 않았습니다.

퓨롤레아는 의약품 규격(specifications), 제조 공정서(manufacturing procedures), 제조 기록서(production records) 생성을 위해 AI 에이전트를 도입했습니다. FDA 실사관이 공정 밸리데이션(process validation)이 생략된 이유를 묻자, 회사 측은 AI 에이전트가 해당 요구사항을 플래그(flag) 처리하지 않았기 때문이라고 답변했습니다.

FDA는 품질관리 부서(Quality Control Unit)가 모든 기록과 규격을 검토해야 한다고 명시한 21 CFR 211.22(c) 규정을 인용하며 다음과 같이 명확히 밝혔습니다: 기업이 문서 작성 보조 수단으로 AI를 사용하는 경우, 해당 문서가 정확하고 cGMP를 준수하는지 확인하기 위해 AI가 생성한 문서를 반드시 검토해야 합니다.

“AI가 그렇게 말했다(The AI said so)“는 이제 규제 당국의 법적 집행 조치(enforcement action)에서 사상 최초로 문서화된 공식 cGMP 위반 사유가 되었습니다.

이 경고 서한은 QMS(품질경영시스템) 소프트웨어 업계의 모든 판도를 바꾸어 놓았습니다. Veeva, MasterControl, ComplianceQuest, Dot Compliance, Arena, Ideagen 등 모든 주요 QMS 벤더가 현재 앞다투어 AI 기능을 출시하고 있기 때문입니다. 그리고 그들 중 어느 누구도 해당 기능에 대한 완전한 밸리데이션 패키지를 공개하지 못했습니다.

어떤 QMS 벤더도 말하고 싶어 하지 않는 문제

전통적인 컴퓨터 시스템 밸리데이션(CSV, Computer System Validation)은 단순한 논리를 따릅니다. 입력을 정의하고, 출력을 테스트하며, 동일한 입력이 항상 동일한 출력을 산출하는지 검증합니다. GAMP 5 V-모델도, IQ/OQ/PQ도, 21 CFR Part 11도 모두 이를 위해 구축되었습니다.

하지만 대규모 언어 모델(LLM)은 이러한 모든 가정을 무너뜨립니다.

동일한 입력, 상이한 출력. LLM에 동일한 질문을 두 번 던지면 서로 다른 대답이 돌아옵니다. Temperature 설정을 낮추면 변동성을 줄일 수는 있지만 완전히 없앨 수는 없습니다. 동일한 일탈 설명에 대해 월요일에는 “제조 — 온도 이탈(Manufacturing — Temperature Excursion)“로 분류하고, 화요일에는 “환경 — 공조(HVAC) 고장(Environmental — HVAC Failure)“으로 분류하는 일탈 분류 시스템은 전통적인 테스트 스크립트로는 결코 밸리데이션할 수 없는 시스템입니다.

불투명한 로직(Non-transparent logic). 모델이 특정 출력을 생성한 이유를 추적할 수 없습니다. 모델의 “추론”은 감사 가능한 비즈니스 규칙이 아니라 수십억 개의 가중치 매개변수(parameters)의 결과물입니다. 실사관이 “시스템이 이 일탈을 중대(Major)가 아니라 치명적(Critical)으로 분류한 근거가 무엇인가?“라고 물었을 때, “모델의 가중치가 그렇게 결정했습니다”라는 답변은 21 CFR Part 11을 만족시킬 수 없습니다.

예고 없는 동작 변화. Anthropic이 Claude를 업데이트하거나 OpenAI가 GPT를 업데이트하는 순간, 귀사의 “밸리데이션된” 시스템은 동작이 즉시 달라집니다. 변경 관리(Change Control)도, 영향 평가(Impact Assessment)도, 재밸리데이션(Re-validation)도 거치지 않은 채 말입니다. 귀사의 QA 팀이 2월에 밸리데이션한 모델은 7월에 프로덕션에서 실행 중인 모델과 더 이상 동일하지 않습니다.

환각(Hallucination). LLM은 매우 자신만만하고 그럴듯하지만 완전히 잘못된 출력을 생성할 수 있습니다. 환각으로 만들어진 CAPA 권고사항, 지어낸 근본 원인(root cause), 날조된 규제 참조 조항 등이 대표적입니다. GxP 환경에서 이는 단순한 버그가 아니라, 환자의 안전을 직접적으로 위협하는 중대한 위험 요소입니다.

ISPE GAMP AI 가이드가 실제로 규정하는 내용

2025년 7월, ISPE(국제제약기술협회)는 모든 QMS 벤더가 반드시 읽었어야 할 290페이지 분량의 문서인 GAMP Guide: Artificial Intelligence를 발간했습니다. 이는 GAMP 5 제2판(Second Edition)의 부속 가이드이며, FDA와 EMA 실사관들이 AI 지원 QMS를 어떻게 밸리데이션했는지 질문할 때 여러분이 이미 완벽히 숙지하고 있을 것으로 전제하는 핵심 문서입니다.

이 가이드는 기존의 전통적 밸리데이션과 비교하여 근본적으로 달라진 5가지 새로운 요소를 정의합니다:

1. AI 특화 품질 위험 관리(AI-specific Quality Risk Management). 기존의 위험 평가는 “시스템에 어떤 문제가 발생할 수 있는가?“를 묻습니다. 반면 AI 위험 평가는 다음과 같은 질문을 추가로 던져야 합니다: 훈련 데이터에 편향이 있다면 어떻게 되는가? 입력 데이터의 분포가 달라지면(distribution shift) 어떻게 되는가? 모델이 과적합(overfitting)되거나 성능 저하(drift)가 발생하면 어떻게 되는가? 이러한 위험 범주는 결정론적(deterministic) 소프트웨어에는 존재하지 않았던 것들입니다.

2. 동적 시스템(Dynamic systems). 전통적인 시스템은 릴리스 버전 사이에서 동작이 임의로 변경되지 않습니다. 하지만 LLM은 제공업체의 업데이트 하나만으로도 동작이 바뀔 수 있습니다. 가이드는 이를 개념 단계(시스템 적응 여부를 사전에 결정), 프로젝트 단계(재학습 트리거 정의), 운영 단계(드리프트 모니터링) 등 전체 생명주기 전반에 걸쳐 다룹니다.

3. AI 사이버 보안. 프롬프트 주입(Prompt injection), 적대적 공격(Adversarial attacks), 데이터 오염(Data poisoning) 등은 기존 GAMP 5 환경에서는 존재하지 않았던 새로운 공격 벡터(attack vectors)입니다.

4. AI 공급업체 적격성 평가(Supplier qualification for AI vendors). QMS 벤더가 Anthropic의 Claude나 Amazon Bedrock을 사용하는 경우, 적격성 평가는 해당 LLM 제공업체까지 확장되어야 합니다. 그들의 모델 업데이트 정책은 무엇인가? 데이터 보존 정책은 어떠한가? 그들이 제공할 수 있는 밸리데이션 증거는 무엇인가?

5. 지속적 밸리데이션(Continuous validation). 2월에 AI 시스템을 밸리데이션했다고 해서 11월에도 여전히 유효할 것이라고 가정할 수는 없습니다. 가이드는 지속적인 성능 및 드리프트 모니터링 증거를 명시적으로 요구합니다.

주요 QMS 벤더들의 대응 방식 (그리고 그들이 밝히지 않는 사실들)

Veeva

Veeva의 AI Agent는 Amazon Bedrock 기반의 Anthropic 및 Amazon LLM을 사용하며, 고객이 자체 제공하는 모델도 지원합니다. Quality AI Agent는 2026년 4월에 출시됩니다.

Veeva의 밸리데이션 접근 방식: Vault 플랫폼 자체는 밸리데이션되어 있으며, AI 에이전트는 해당 플랫폼의 확장 기능으로 밸리데이션된다는 논리입니다. 모든 AI 작업은 Vault 감사 추적(audit trail)에 기록되며, 정해진 의사결정 시점에 인간 검토자가 검증, 승인 또는 오버라이드(override)를 수행합니다.

Veeva가 공개하지 않은 것들: AI 기능에 대한 실제 IQ/OQ/PQ 문서, 구체적인 정확도 지표(accuracy metrics), Anthropic 모델 업데이트에 대한 처리 방식, 프로덕션 환경에서의 환각률(hallucination rate), 프롬프트 밸리데이션 방법론.

MasterControl

MasterControl은 5가지 지정된 AI 도구(Automated Risk Assessment, KPI Analyzer, APQR Generator, Auto Lot Tracking Report Generator, Quality Event Report Summary Generator)를 제공합니다. 이들은 ISO 42001 인증을 획득한 유일한 QMS 벤더라는 차별점을 가지고 있습니다.

ISO 42001 인증은 실질적이고 의미 있는 성과입니다. 이는 이들의 AI 관리 체계가 독립적인 감사를 통과했음을 뜻합니다. 그러나 ISO 42001은 관리 시스템(management system)을 인증하는 것이지, 개별 AI 출력물의 정확도를 인증하는 것이 아닙니다.

MasterControl이 공개하지 않은 것들: 각 AI 도구의 정확도 지표, 밸리데이션 테스트 결과, 환각률, LLM 제공업체의 모델 변경 관리 방안.

ComplianceQuest

CQ.AI Agent는 2025년 여름에 출시되었습니다. Salesforce Einstein을 기반으로 구축되었으며, QMS 분야에서 가장 성숙한 Salesforce 네이티브 AI입니다.

ComplianceQuest는 Salesforce의 AI 거버넌스 프레임워크를 그대로 상속합니다. 부적합(nonconformance) AI, 위험 권고사항, 근본 원인 조사 등 구체적인 기능들은 실용적이며 프로덕션 환경에 바로 적용할 수 있는 수준입니다.

ComplianceQuest가 공개하지 않은 것들: 다른 모든 벤더와 마찬가지입니다. 공개된 밸리데이션 패키지가 없으며, 정확도 지표도, 환각률 수치도 공개되지 않았습니다.

Dot Compliance

Dottie AI는 현재 3세대까지 발전했습니다. 설립(2015년) 초기부터 ’AI-퍼스트’로 설계되었으며, 첫날부터 AI를 중심으로 아키텍처를 구축한 유일한 QMS 벤더입니다.

Dot Compliance의 “버티컬 AI(vertical AI)” 포지셔닝은 주목할 만합니다. Dottie는 일반적인 범용 LLM을 QMS에 덧붙인 것이 아니라 생명과학 품질 관리를 위해 특화 설계되었습니다. 그러나 이들 역시 구체적인 밸리데이션 증거를 공개하지 않았습니다.

공통된 패턴 (The pattern)

모든 벤더가 플랫폼은 밸리데이션합니다. 하지만 ISPE GAMP AI 가이드가 요구하는 방식으로 AI 모델 자체에 대한 밸리데이션을 공개한 벤더는 단 한 곳도 없습니다. 껍데기(wrapper)는 밸리데이션되었지만, 두뇌(brain)는 여전히 규제적 회색지대에 머물러 있습니다.

FDA의 7단계 신뢰성 평가 프레임워크가 요구하는 것

2025년 1월 FDA 초안 가이던스는 AI 밸리데이션을 위한 구조화된 프레임워크를 제시합니다:

  1. 관심 질문 정의 (Define the question of interest) — AI가 어떤 구체적인 의사결정에 정보를 제공하는가?
  2. 사용 맥락 정의 (Define the context of use) — AI의 출력이 어떻게 활용될 것인가?
  3. 모델 위험 평가 (Assess the model risk) — AI가 오류를 범할 경우 어떤 영향이 발생하는가?
  4. 필요한 신뢰성 증거 결정 (Determine the credibility evidence needed) — 위험도에 비례하는 적절한 증거 수준은 무엇인가?
  5. 신뢰성 증거 생성 (Generate the credibility evidence) — 테스트, 밸리데이션, 모니터링 수행
  6. 증거의 충분성 평가 (Assess whether the evidence is sufficient) — 규제 기준치를 충족하는가?
  7. 문서화 및 유지 관리 (Document and maintain) — 지속적인 모니터링 및 재평가

이 프레임워크는 특정한 테스트 방식을 일률적으로 규정하지 않습니다. 대신 위험 기반 프로세스를 규정합니다. 그리고 매우 중요한 점을 분명히 합니다: 입증 책임(burden of proof)은 소프트웨어 벤더가 아니라 AI를 현장에 배포하여 운영하는 기업에 있다는 사실입니다.

현업에서 실제로 효과가 입증된 접근법

지난 12~18개월 동안 글로벌 상위 10대 제약사 중 다수가 LLM 활용 사례를 파일럿 단계에서 밸리데이션된 프로덕션 단계로 전환하는 데 성공했습니다. 완전한 밸리데이션 패키지는 대외비이지만, 학회 발표, 벤더 공개 자료, 업계 분석 등을 통해 그 공통된 패턴을 충분히 재구성할 수 있습니다.

가장 먼저 프로덕션에 진입한 유스케이스들

밸리데이션된 프로덕션에 최초로 도달한 LLM은 결코 가장 원대한 유스케이스가 아니었습니다. 언제나 “인간의 검토를 거치는 의사결정 지원(decision support with human review)” 형태였습니다:

  • 규제 인허가 문서 초안 작성 — LLM이 초안을 작성하고, 인간 전문가가 검토
  • 약물감시(Pharmacovigilance) 사례 분류(triage) — LLM이 분류를 제안하고, 사례 처리자가 검증
  • SOP 검색 및 질의응답 — LLM이 SOP 내용에 기반해 질문에 답하되, 원본 SOP가 최종 권위를 갖는다는 제약 사항을 문서화
  • 임상 프로토콜 초안 작성 지원 — LLM이 초안 문구를 작성하고, 임상 운영팀이 최종 확정

공통 패턴: LLM은 보조하고, 인간이 결정합니다. 인간의 검토가 곧 통제점(control point)이 됩니다.

규제 실사를 견뎌내는 밸리데이션 체계

GxP 환경에서 LLM을 성공적으로 밸리데이션한 팀들은 일관된 체계를 따르고 있습니다:

  1. 모델 버전 고정(Lock the model version). 특정 모델, 특정 버전, 특정 구성을 확정하고 이를 문서화합니다.
  2. Temperature를 0으로 설정. 결정론적 특성을 극대화합니다. 부동소수점 연산 등으로 인해 완전한 결정론은 아니지만, 밸리데이션을 진행하기에 충분한 수준으로 안정화됩니다.
  3. 사용 목적(Intended Use)을 좁게 정의. “품질 관리 지원”과 같은 모호한 표현 대신 “일탈을 5가지 범주로 분류”와 같이 명확히 정의합니다.
  4. 테스트 데이터셋 구축. 실무 전문가(SME)가 검토하고 정답 라벨이 확보된 도메인 특화 데이터셋을 준비합니다.
  5. 테스트 세트를 N회 반복 실행. 일반적으로 100~1,000회 실행합니다. SME의 분류 기준과 비교하여 정확도(accuracy), 정밀도(precision), 재현율(recall)을 측정합니다.
  6. 판정 기준(Acceptance Criteria) 수립. 통상 인간 전문가 검토와의 일치도 85~95%를 기준으로 설정합니다.
  7. 실패 모드(Failure Modes) 문서화. 알려진 한계점, 환각 발생 패턴, 엣지 케이스 등을 철저히 기록합니다.
  8. 프롬프트를 코드처럼 취급. 버전 관리, 테스트, 변경 관리를 적용합니다. 프롬프트 변경은 곧 변경 관리(Change Control) 안건입니다.
  9. 모든 의사결정 지점에 Human-in-the-Loop 적용. AI가 제안하고 인간이 승인합니다.
  10. 배포 후 모니터링. 시간에 따른 정확도를 추적하고, 성능 드리프트를 감지하며, 성능 저하 시 재밸리데이션을 트리거합니다.

실제 성공 사례

이 프레임워크를 따른 일탈 분류 LLM은 SME 검토 대비 94%의 정확도를 달성했으며, 배치당 처리 시간을 4시간에서 30분으로 대폭 단축했습니다. 밸리데이션 문서에는 모델 버전, Temperature 설정, 프롬프트 템플릿 버전, 과거 일탈 데이터 500건으로 구성된 테스트 데이터셋, 90% 이상의 일치도 판정 기준, 그리고 AI가 생성한 모든 분류에 대한 인간 검토 의무화가 명확히 기록되었습니다.

이것이 바로 규제 실사관이 납득할 수 있는 정석적인 밸리데이션 패키지입니다.

모든 QMS 구매 담당자가 반드시 물어야 할 핵심 질문

QMS 벤더가 자사의 AI 기능을 시연할 때, 단순히 “이거 밸리데이션되었나요?“라고 묻지 마십시오. 대신 다음 질문들을 던져야 합니다:

  1. 어떤 LLM 모델과 버전을 사용하고 있습니까? 이 질문에 즉답하지 못한다면 버전 관리가 전혀 이루어지지 않고 있는 것입니다.
  2. LLM 제공업체가 모델을 업데이트하면 어떤 절차를 거치나요? 명확한 답변이 없다면, 귀사의 “밸리데이션된” 시스템은 예고 없이 동작이 변할 것입니다.
  3. 실제 프로덕션 환경에서 측정한 정확도는 얼마입니까? 구체적인 수치를 제시하지 못한다면, 아예 측정조차 하지 않은 것입니다.
  4. 프롬프트 변경을 변경 관리(Change Control) 절차로 어떻게 처리합니까? 프롬프트가 버전 관리되지 않는다면, 그 시스템은 변경 관리 통제하에 있지 않습니다.
  5. 환각 발생률(Hallucination rate)은 얼마입니까? 측정해 보지 않았다면 벤더조차 알지 못합니다.
  6. ISPE GAMP AI 가이드를 준수하고 있습니까? 이 가이드를 읽어보지도 않았다면, 업계 표준에서 한참 뒤처져 있는 것입니다.
  7. AI 밸리데이션 패키지를 직접 볼 수 있습니까? 영업용 슬라이드가 아니라 실제 밸리데이션 문서여야 합니다. 이를 제시하지 못한다면, 밸리데이션을 수행하지 않은 것입니다.

불편한 진실

“GxP 환경에서 비결정론적인 LLM을 어떻게 밸리데이션할 것인가?“라는 질문에 대한 솔직한 답은 바로 **“업계 전체가 여전히 그 방법을 찾아가는 중”**이라는 점입니다.

ISPE GAMP AI 가이드가 프레임워크를 제시하고, FDA의 신뢰성 평가 프레임워크가 체계를 제공하며, 퓨롤레아 경고 서한이 규제 집행의 선례를 만들었습니다. 하지만 Veeva, MasterControl, ComplianceQuest, Dot Compliance 중 그 어떤 QMS 벤더도 자사의 LLM 기능에 대해 GAMP AI 가이드를 완벽히 준수하는 종합 밸리데이션 패키지를 공개하지 못했습니다.

현재 가장 근접해 있는 벤더는 MasterControl(ISO 42001 인증 획득, 5개의 제한적 AI 도구)과 Veeva(플랫폼 레벨 밸리데이션 및 AI 에이전트 확장)입니다. 하지만 “가장 근접했다”는 말이 “완성되었다”는 뜻은 아닙니다.

퓨롤레아 경고 서한은 명백한 선례를 남겼습니다: AI에 대한 과도한 의존은 cGMP 위반입니다. 다음 경고 서한은 QMS 벤더의 AI 기능을 도입하면서 자사의 구체적인 사용 사례에 맞게 밸리데이션하지 않은 제약사가 받게 될 것입니다. 벤더는 “우리는 플랫폼을 제공할 뿐이며, 밸리데이션 책임은 고객에게 있다”고 말할 것이고, 고객사는 “벤더가 밸리데이션된 시스템이라고 말했다”고 항변할 것입니다. 그리고 FDA는 고객사에 지적 사항을 발행할 것입니다.

GxP 규제 환경에서 최종적인 책임은 결코 소프트웨어 벤더가 아니라, 제품을 생산하고 유통하는 제약기업에 있기 때문입니다.

QMS AI 경쟁은 현실입니다. 새로운 기능들이 쏟아져 나오고 있습니다. 35%의 생산성 향상, 신속한 일탈 분류, 개선된 CAPA 조사 등 그 효용 또한 가시적입니다. 하지만 밸리데이션 격차(validation gap) 역시 엄연한 현실입니다. 그리고 이 격차를 가장 먼저 좁혀 실사 방어가 가능한 완벽한 AI 밸리데이션 패키지를 공개하는 기업이 압도적인 경쟁 우위를 점하게 될 것입니다.

그때까지는 날카로운 질문을 멈추지 마십시오. 모든 것을 철저히 문서화하십시오. 그리고 명심하십시오: “AI가 그렇게 말했다”는 결코 변명이 될 수 없습니다.