생명과학 분야에서 AI 프로젝트를 진행할 때마다 늘 나오는 질문이 있습니다: “실제로 환각(Hallucination)을 완전히 없애려면 어떻게 해야 합니까?”
단순히 줄이거나 관리하는 수준이 아니라, 완전히 ’제거’하는 것을 의미합니다. GxP 규제 환경에서 환각은 단순한 챗봇의 사소한 실수가 아닙니다. 이는 잠재적인 FDA 경고 서한(Warning Letter), 환자 안전 사고, 혹은 규제 제출(submission) 실패로 직결되기 때문입니다.
수많은 아키텍처 분석, 최신 학술 연구, 역사상 최초의 FDA AI 경고 서한(2026년 4월, Purolea 사건), ISPE GAMP AI 가이드, 그리고 AWS Automated Reasoning Checks와 같은 프로덕션 도구를 종합해 볼 때 답은 명확합니다: 다중 에이전트 심층 방어(defense-in-depth) 아키텍처가 필수적입니다. 단일 에이전트, 단일 기법, 혹은 그 어떤 프롬프트 엔지니어링만으로는 결코 이 목표를 달성할 수 없습니다.
여러 분석들은 동일한 근본적인 패턴으로 수렴하고 있습니다. 다만 세분성(granularity)의 차이, 즉 얼마나 많은 특화된 역할을 분리할 것인지, 그리고 각각의 역할이 어떤 엣지 케이스를 포착할 것인가에 대한 관점만 다를 뿐입니다.
보편적 합의: 타협할 수 없는 7가지 원칙
이 문제에 대한 모든 진지한 아키텍처 분석에서 공통적으로 나타나는 원칙들이 있습니다:
1. 단일 에이전트로는 이를 해결할 수 없습니다. LLM은 본질적으로 확률론적(probabilistic)이지만, 규제는 결정론(determinism)을 요구합니다. 이 간극을 메우는 유일한 방법은 에이전트들이 서로를 상호 교차 검증하는 견제와 균형(checks and balances) 시스템입니다.
2. 검색(Retrieval)은 반드시 생성(Generation)보다 선행되어야 합니다. 검증되고 버전 관리되는 지식 베이스(SOP, 임상 데이터, 규제 가이드라인)를 질의하는 RAG 에이전트가 모든 응답의 근거(grounding)를 마련해야 합니다. LLM은 자체적인 매개변수 메모리(parametric memory)에 의존해 즉흥적으로 답변을 지어내서는 안 됩니다.
3. 생성은 엄격히 제약되어야 합니다. 초안 작성 에이전트는 사전 학습된 지식을 사용하는 것이 금지됩니다. 검색된 컨텍스트에 답변이 포함되어 있지 않다면, 허용되는 유일한 출력은 “검증된 출처 내에 충분한 데이터가 없습니다(Insufficient data in verified sources)“뿐입니다.
4. 검증은 적대적(adversarial)이어야 합니다. 별도의 에이전트가 초안과 소스 문서를 문장 단위로 면밀히 비교합니다. 이는 단순한 문체 점검이 아니라 사실적 함의(factual entailment) 검증입니다.
5. 인간의 개입은 필수불가결합니다. 모든 분석에는 인간 참여 루프(HITL, Human-in-the-Loop) 에스컬레이션 에이전트가 포함됩니다. 신뢰도가 임계값 아래로 떨어지면, 처리를 자동으로 진행하지 않고 자격을 갖춘 주제 전문가(SME, Subject Matter Expert)에게 즉시 라우팅합니다.
6. 감사 추적(Audit Trail)은 의무 사항입니다. 모든 프롬프트, 검색, 에이전트 간 전달(handoff), 의사결정에 대한 변경 불가능한 로그를 기록해야 합니다. 이는 21 CFR Part 11, EU AI Act 및 GxP 실사 대비를 위해 필수적입니다.
7. LLM은 언어 번역기일 뿐, 결코 진실의 원천(source of truth)이 아닙니다. 모델의 역할은 검증된 출처가 말하는 바를 명확하게 표현하는 것이지, 무언가를 스스로 알고 판단하는 것이 아닙니다.
에이전트 수에 대한 논쟁: 4개에서 10개까지
제안된 아키텍처는 최소 4개의 에이전트 구성부터 완전한 10개 에이전트 조립 라인(assembly line)까지 다양합니다. 이러한 격차는 문제 자체에 대한 이견이 아니라, 어떤 실패 모드(failure mode)에 전담 에이전트를 배정할 것인지, 어떤 것을 더 넓은 역할로 처리할 수 있는지에 대한 관점 차이에서 비롯됩니다.
| 에이전트 수 | 아키텍처 스타일 |
|---|---|
| 4개 | 최소 기능 구현 — 검색(Retrieval), 생성(Generation), NLI 검증, 규제 준수(Compliance) |
| 5-7개 | 계층형 — 자동 추론(Automated Reasoning), 다중 모델 합의(Cross-Model Consensus), 결정론적 도구 사용(Deterministic Tool-Use), 전담 감사자(Auditor) 추가 |
| 9개 | 확장형 — 시점 유효성(Temporal Validity), 과학적 일관성(Scientific Consistency), 적대적 탐침(Adversarial Probe) 추가 |
| 10개 | 완전한 조립 라인 — 의미론적 충실도(Semantic Fidelity), 임상 안전/PV(Clinical Safety/PV), 신뢰도 점수 산출(Confidence Scoring) 추가 |
환각으로 인한 비용이 경고 서한과 환자 피해로 직결되는 규제 대상 생명과학 환경에서는 10개의 에이전트 구성이 정답입니다. 다음은 각 에이전트의 역할과 이를 생략할 수 없는 이유입니다.
실제로 필요한 10개의 에이전트
에이전트 1: 의미론적 충실도 에이전트 (Semantic Fidelity Agent)
아마도 가장 중요하면서도 가장 간과되기 쉬운 에이전트일 것입니다. 이 에이전트는 작성된 문장의 *의미론적 의미(semantic meaning)*를 원본 텍스트와 비교하며, 미묘한 임상적 드리프트(clinical drift)를 포착하도록 특별히 훈련되었습니다. 예를 들어 “~를 유발할 수 있다(may cause)“를 “~를 유발한다(causes)“로 바꾸거나, “진행을 둔화시켰다(reduced progression)“를 “진행을 중단시켰다(halted progression)“로 미세하게 바꾸는 경우를 잡아냅니다.
이는 생명과학 분야에서 가장 위험한 유형의 환각입니다. 표면적으로는 95% 정확해 보이지만 결정적인 임상적 의미를 왜곡하기 때문입니다. 일반적인 사실 검증 도구는 주장이 대체로 맞기 때문에 이를 놓칠 수 있습니다. 의미론적 충실도 에이전트는 바로 이러한 미세한 차이(delta)를 감지해냅니다.
에이전트 2: 시점 유효성 에이전트 (Temporal Validity Agent)
생명과학 분야는 시점 관련 환각(temporal hallucinations)으로 인해 큰 골머리를 앓고 있습니다. 모델은 2021년에는 사실이었지만 2026년에는 사실이 아닌 정보, 즉 철회된 약물 적응증, 갱신된 라벨, 폐기된 가이드라인 문서 등을 자신 있게 말하곤 합니다.
이 에이전트는 라벨 변경 내역, 안전성 서신, 블랙박스 경고 추가, 그리고 승인 철회 현황을 추적합니다. 이는 “약물 X는 질환 Y에 적응증이 있다”(학습 컷오프 시점 기준 참)와 “약물 X의 질환 Y에 대한 적응증은 2026년 3월에 철회되었다”(현재의 실제 상황)를 구별해내는 핵심 역할을 합니다.
에이전트 3: 적대적 탐침 에이전트 (Adversarial Probe Agent)
답변이 인간 검토자에게 도달하기 전에 이 에이전트가 답변을 스트레스 테스트(stress-test)합니다. “이 답변과 모순되는 증거는 무엇인가?”, “모델이 허위 정보(confabulation)를 지어내고 있다면 어떤 형태일 것인가?“와 같은 반사실적 질문을 던집니다. 또한 질문을 살짝 변형해보고 답변이 실질적으로 바뀌는지 확인하는 섭동 테스트(perturbation test)를 실행합니다.
질문 표현 변경에 따른 답변의 불안정성은 강력한 환각 징후입니다. “약물 X의 반감기는 얼마인가?“와 “약물 X는 체내에 얼마나 머무르는가?“라는 질문에 일관되지 않은 답변이 나온다면 둘 중 하나는 잘못되었을 가능성이 큽니다.
에이전트 4: 결정론적 도구 사용 에이전트 (Deterministic Tool-Use Agent)
LLM은 수학적 계산에 취약한 것으로 악명이 높습니다. 생명과학 분야에서 잘못 계산된 약물 용량, 희석 배수, 혹은 약동학(pharmacokinetic) 파라미터는 단순한 반올림 오차가 아니라 심각한 환자 안전 사고로 이어집니다. 이 에이전트는 정량적 작업을 LLM 생성에 맡기지 않고 Python 코드 실행으로 라우팅합니다. 모델은 최종적으로 수학적으로 검증된 출력을 해석하기만 할 뿐, 계산 자체를 직접 수행하지 않습니다.
에이전트 5: 다중 모델 합의 에이전트 (Cross-Model Consensus Agent)
동일한 질의를 서로 다른 여러 모델(예: Llama, Qwen, Mistral)에 전달하고 일치 여부를 확인합니다. 한 인용된 프로토콜에서는 7개 모델을 사용하여 생체의학 연관성 테스트에서 환각을 0%로 줄였습니다. Dissanayake와 Wickramaarachchi의 2025년 IEEE 논문에서는 GPT-5, Claude Sonnet 4.5, Gemini 2.5 Flash, DeepSeek-V2.5를 활용한 우선순위 기반 다중 모델 검증 시스템을 선보였으며, 지능형 다중 LLM 합의 메커니즘을 통해 환각 탐지 성능을 획기적으로 향상시켰습니다.
에이전트 6: NLI 검증 에이전트 (NLI Verification Agent)
자연어 추론(Natural Language Inference)을 활용하여 함의(Entailed) / 모순(Contradicted) / 중립(Neutral)의 3방향 분류(three-way classification)를 수행합니다. 초안의 모든 주장을 세부적으로 분해한 뒤 소스 문서를 기준으로 분류합니다. 어떤 주장이 “중립(Neutral)“으로 분류된다면(즉, 소스 문서가 이를 지지하지도 모순되지도 않음을 의미), 규제 환경에서는 정의상 환각으로 간주됩니다. 뒷받침되지 않는 주장에는 결코 의심의 여지(benefit of the doubt)를 주지 않습니다.
ACL의 SciHal 2025 공용 과제(shared task)에서는 복잡한 특성 기반 파이프라인보다, 512토큰의 컨텍스트 창만을 가진 NLI 적응형 인코더 모델을 단순 미세조정(fine-tuning)한 것이 더 뛰어난 성능을 보였습니다.
에이전트 7: 규제 준수 에이전트 (Regulatory Compliance Agent)
FDA/EMA 규제 프레임워크, 오프라벨(허가 외) 판촉 규정, 필수 공개 고지 사항, GxP 용어 제약 조건에 맞춰 출력을 점검합니다. 사실상 진실인 진술이라 할지라도 승인되지 않은 효능을 암시하거나 필수 위험 문구를 누락한 경우 규정 위반이 될 수 있습니다.
에이전트 8: 임상 안전 / 약물 감시 에이전트 (Clinical Safety / Pharmacovigilance Agent)
이상반응, 금기사항, 블랙박스 경고를 점검하는 규칙 기반(rules-based) 에이전트입니다. 결정론적 안전망 역할을 수행하여, 초안에서 “환자는 약물 X 복용을 중단해야 한다”고 작성되었으나 원본 라벨에 “복용 중단 전 의사와 상담할 것”이라고 되어 있는 경우 모순을 즉시 플래그 처리합니다.
에이전트 9: 신뢰도 점수 산출 및 HITL 에스컬레이션 에이전트 (Confidence Scoring + HITL Escalation Agent)
모든 검증 에이전트의 결과를 종합하여 복합 신뢰도 점수를 산출합니다. 엄격한 임계값(생명과학 분야에서는 95% 이상) 미만인 경우, 전체 소스 컨텍스트 및 세부 플래그와 함께 인간 SME(전문가)에게 라우팅합니다. 임계값을 초과하는 경우에만 감사 추적과 함께 승인 처리됩니다. 이 에이전트는 시스템을 지속적으로 보정(calibrate)하며, 인간의 교정 내역을 학습하여 시간이 지남에 따라 위험 임계값을 정밀하게 조정합니다.
에이전트 10: 감사 추적 로거 (Audit Trail Logger)
모든 프롬프트, 검색, 에이전트 간 핸드오프, 검증 결과, 의사결정에 대해 타임스탬프가 찍힌 변경 불가능한(immutable) 기록을 유지합니다. 설계 단계부터 21 CFR Part 11을 완벽히 준수합니다. 텍스트 자체를 변경하지는 않으며, 모든 답변이 어떻게 생성되었는지를 입증하는 역할을 합니다.
최신 연구가 말해주는 실증적 증거
체계적 문헌고찰(Systematic Review) 결과
BMC Health Services Research에 게재된 2026년 6월 PRISMA 체계적 문헌고찰(Basu & Huynh)은 2019년부터 2025년까지의 실증 연구 44편을 분석하여 7가지 환각 완화 전략 범주를 도출했습니다:
- RAG (44편 중 18편): 환각 30~50% 감소
- 지식 그래프(Knowledge Graph) 통합 (12편): 벡터 전용 검색 대비 정형화된 트리플(triples) 활용
- 자가 성찰(Self-reflection) 프레임워크 (10편): 모델이 자체 산출물을 점검
- 인간 참여 루프(HITL) 접근법: 최대 95% 감소를 달성했으나 확장성(scalability) 한계 존재
- 레드팀(Red teaming): 환각 탐지율 20~40% 개선
- 특화 학습 기법: 도메인 특화 미세조정
- 특화 평가 지표: 목적 맞춤형 점수 산출
여기서 결정적인 발견은 결합된 접근 방식(예: 검색과 검증의 병행)이 단일 기법 통제군보다 일관되게 우수한 성능을 보였다는 점입니다. 이것이 바로 다중 에이전트 아키텍처에 대한 실증적 근거입니다. 그 어떤 단일 기법도 단독으로는 충분하지 않습니다.
에이전트형 AI(Agentic AI) 연구 결과
Gosmar와 Dahl의 연구(arXiv:2501.13946, 2025년 1월)에서는 환각을 유발하는 300개 이상의 프롬프트를 사용하여 4단계 에이전트 파이프라인을 구축했습니다. 각 단계는 서로 다른 LLM과 맞춤형 전략을 적용했습니다. 이들은 환각 점수 산출을 위한 새로운 KPI를 도입하고, NLP 기반 에이전트 상호운용성을 위해 OVON(Open Voice Network) 프레임워크를 활용했습니다. 연구 결과, 다중 에이전트 NLP 프레임워크가 “환각 완화에서 매우 유망한 성과”를 도출하는 것으로 나타났습니다.
Darwish 등의 2025년 MDPI 논문은 한 걸음 더 나아가, LLM 동작을 제약하기 위한 규칙 기반 로직을 통합하고 정량적 성능 점수 메커니즘을 도입하여 응답 일관성을 85.5% 향상시켰습니다.
NLI 접근법
다수의 논문이 자연어 추론(NLI)을 검증의 핵심 중추로 꼽고 있습니다. HALT-RAG 프레임워크는 고정된(frozen) 두 개의 NLI 모델과 경량 어휘 특성의 앙상블이 RAG 파이프라인의 효과적인 사후(post-hoc) 검증 시스템으로 기능할 수 있음을 입증했습니다. 3방향 NLI 분류(함의 / 모순 / 중립)는 업계 표준 검증 패러다임으로 빠르게 자리잡고 있습니다.
규제 환경의 현실적 변화
Purolea 경고 서한 사건
2026년 4월 2일, FDA는 cGMP 제조 공정에서 AI 오용을 지적한 역사상 최초의 경고 서한(Warning Letter)을 발행했습니다. 대상은 미시간주 리보니아에 위치한 퓨롤리아 코스메틱스 랩(Purolea Cosmetics Lab)이었습니다.
해당 기업은 적절한 품질 부서(Quality Unit)의 감독 없이 AI 에이전트를 사용하여 의약품 규격, 제조 절차 및 생산 기록을 작성했습니다. FDA는 품질 부서의 감독 미흡에 대해 21 CFR 211.22(c)를, 생산 및 공정 관리 실패에 대해 21 CFR 211.100을 위반 사항으로 적시했습니다.
컴플라이언스 그룹(The Compliance Group)의 해당 서한 분석에서는 18가지 원칙을 도출했습니다. 그중 가장 중대한 원칙은 다음과 같습니다: “AI는 이제 다른 모든 GxP 시스템과 동일하게 취급된다. 여기에 한 가지 계층이 추가되었다: 바로 의사결정 무결성(decision integrity)이다.”
이는 기존의 데이터 무결성(data integrity)에서 의사결정 무결성으로의 전환을 의미합니다. AI가 주도한 잘못된 의사결정(잘못 분류된 일탈, 검토는 되었으나 제대로 이해되지 않은 자동 생성 규격, LLM 요약본에 의존해 승인된 교육 훈련 기록 등)은 위조된 기록만큼이나 확실하게 환자 안전 실패를 초래할 수 있습니다.
ISPE GAMP 가이드: 인공지능 (2025년 7월)
국제제약공학회(ISPE)는 GxP 규제 환경에서의 AI에 관한 최초의 총체적 프레임워크를 발표했습니다. 이 가이드는 AI/ML 지원 컴퓨터화 시스템의 환자 안전, 제품 품질 및 데이터 무결성을 다룹니다. 이는 “그렇다면 이것을 실제로 어떻게 밸리데이션할 것인가?“라는 업계의 오랜 질문에 대한 해답입니다.
AWS Automated Reasoning Checks (2025년 정식 출시)
Amazon Bedrock Guardrails는 이제 자동 추론(Automated Reasoning) 검사 기능을 제공합니다. 이 기능은 수학적 논리와 정형 증명(formal proofs)을 사용하여 인코딩된 정책에 대해 LLM 출력을 검증합니다. AWS는 최대 99%의 검증 정확도를 주장합니다. 규제 산업 관점에서 이는 매우 중요합니다. ‘결정론적 검증’ 원칙을 클라우드 네이티브 환경에서 프로덕션 수준으로 구현한 것이기 때문입니다.
이 접근법은 도메인 지식을 정형 정책(formal policies)으로 인코딩하고, 생성된 콘텐츠가 해당 규칙과 일치하는지 수학적으로 검증합니다. 이는 또 다른 LLM에게 답이 맞는지 묻는 확률론적 검증이 아니라, 규칙과의 일관성을 증명하는 정형 검증(formal verification)입니다.
에이전트들의 상호 작용 구조
User Question
│
▼
[Agent 1] Query Decomposition → atomic sub-questions
│
▼
[Agent 2] Hybrid RAG Retrieval → grounded sources with provenance
│
▼
[Agent 4] Constrained Generation → source-linked draft
│
▼
[Agent 6] NLI Verification ──► [Agent 1] Semantic Fidelity
│ │
├──► [Agent 7] Regulatory Compliance
├──► [Agent 8] Clinical Safety/PV
└──► [Agent 2] Temporal Validity
│
▼
[Agent 5] Cross-Model Consensus (parallel check)
│
▼
[Agent 3] Adversarial Probe (stress test)
│
▼
[Agent 9] Confidence Scoring + HITL Routing
│
▼
Answer delivered (with [Agent 10] full audit trail)
현실적인 한계와 고려사항
그 어떤 아키텍처도 환각을 0으로 완전히 없앨 수는 없습니다. 2026년 6월 체계적 문헌고찰에 따르면 HITL 접근법도 최대 95%의 감소율을 보였으며, 이는 여전히 5%의 잔여 위험(residual risk)이 존재함을 의미합니다.
이 아키텍처가 달성하는 본질적인 역할은 환각을 *은밀하고 자신감 넘치는 오류(silent, confident errors)*에서 *측정 가능하고, 플래그를 지정할 수 있으며, 상위로 에스컬레이션되는 결함(measured, flaggable, escalated defects)*으로 전환하는 것입니다. 잔여 위험은 최종 사용자에게 무방비로 노출되지 않고 의도적으로 인간 검토자에게 라우팅됩니다. 남아 있는 모든 실패 모드는 감지 가능하고, 감사 가능하며, 수정 가능해집니다. 이것이 바로 규제 기관이 진정으로 요구하는 핵심입니다.
Purolea 경고 서한이 명백히 보여준 한 가지 사실이 있습니다. FDA는 더 이상 제약 및 바이오 기업들이 GxP 공정에서 AI를 사용하는지 여부를 묻지 않습니다. 그들은 어떻게 사용하고 있는지를 묻고 있습니다. 지금 이러한 다중 에이전트 인프라를 선제적으로 구축하는 조직만이 1년 후 FDA 밸리데이션을 가장 신속하게 통과하게 될 것입니다. 반면 관망하기만 하는 조직들은 규제 개선 조치(remediation)에 쫓기게 될 것입니다.
참고 문헌: Basu & Huynh (2026), BMC Health Services Research; Gosmar & Dahl (2025), arXiv:2501.13946; Darwish et al. (2025), MDPI Information; Dissanayake & Wickramaarachchi (2025), IEEE; FDA Warning Letter: Purolea Cosmetics Lab (April 2, 2026); ISPE GAMP Guide: AI (July 2025); AWS Automated Reasoning Checks (2025); Compliance Group AI/GxP Analysis (April 2026).
Saram Consulting