어느 품질 보증(QA) 디렉터가 다음과 같이 질문했습니다: “SOP, 일탈(deviation), CAPA, 제조기록서(batch record) 전반을 아우르는 AI 기반 검색 시스템이 필요합니다. RAG, 하이브리드 RAG, Graph RAG 중 어떤 것을 사용해야 할까요?”

이 질문에 대해 5개의 독립적인 분석이 수행되었습니다. 그리고 모두 동일한 결론으로 수렴했습니다. 하지만 그 답은 단순히 “하나를 선택하라”는 것이 아닙니다. 바로 **“계층별(layers)로 구축하고, 각 계층이 어떤 질의 유형을 담당하는지 명확히 정의하라”**는 것입니다.

본 글에서는 이 다섯 가지 분석을 종합하고, 학술 벤치마크 및 실제 규제 소프트웨어 벤더의 구현 사례를 통해 그 주장을 검증하며, QA 팀과 즉시 논의할 수 있는 실질적인 의사결정 프레임워크를 제시합니다.


실질적으로 고려해야 할 7가지 RAG 변형 아키텍처

처음에는 세 가지 아키텍처에 대해 질문하셨지만, 엔터프라이즈 및 규제 산업 환경에서 실질적으로 고려해야 할 아키텍처는 현재 7가지 변형으로 발전했습니다:

# 아키텍처 한 줄 요약
1 표준 / 단순 RAG (Standard / Naive RAG) 청크 분할 → 임베딩 → 벡터 검색 → Top-k 추출 → 텍스트 생성
2 하이브리드 RAG (Hybrid RAG) 벡터(시맨틱) + BM25(키워드) + 리랭커(Reranker)
3 Graph RAG (GraphRAG) 엔티티 및 관계 기반 지식 그래프(Knowledge Graph) + 벡터 검색
4 에이전틱 RAG (Agentic RAG) AI 에이전트가 다단계 검색을 계획하고 도구를 호출하며 반복 탐색
5 교정 RAG (Corrective RAG, CRAG) 생성 전 평가기(Evaluator)가 검색 품질을 채점하고 신뢰도가 낮으면 응답 거부
6 Self-RAG 모델이 성찰 토큰(reflection tokens)을 출력하여 검색 시점 및 답변의 근거 여부를 자체 판단
7 모듈러 RAG (Modular RAG) 파이프라인을 교체 가능한 모듈(라우팅, 리랭킹, 검증 등)로 분해

표준 RAG는 대다수의 팀이 가장 먼저 시작하는 방식입니다. 동시에 규제 환경에서 가장 먼저 실패하는 방식이기도 합니다.


표준 RAG가 품질 문서에서 실패하는 이유

품질 문서에는 단순한 벡터 검색을 무너뜨리는 고유한 특성들이 존재합니다:

정확한 용어 매칭이 핵심입니다. “USP <85>”(세균 엔도톡신 시험법)와 “USP <87>”(생물학적 반응성 시험법)은 텍스트상으로는 의미론적(semantic)으로 유사하지만, 실제 시험에서는 완전히 다른 규격입니다. 벡터 검색은 이 둘을 혼동합니다. “SOP-QA-007”과 “SOP-QA-070” 역시 거의 동일한 임베딩 벡터를 갖게 됩니다.

문서 간 교차 의존성(Cross-document dependencies). “이 제품에 대해 해당 밸리데이션된 시험법을 사용할 수 있는가?“라는 질문에 답하기 위해서는 밸리데이션된 시험법(문서 1)과 제품 규격서(문서 2), 그리고 현행 유효 SOP(문서 3)를 상호 연결해야 합니다. 표준 RAG는 청크를 개별적으로 격리하여 검색하므로 이러한 연결 고리를 만들어내지 못합니다.

버전 관리는 생명과 직결됩니다. 현행 유효 버전이 Rev 3인데 Rev 2의 SOP를 검색해오는 것은 치명적인 컴플라이언스 위반입니다. 표준 RAG에는 문서 개정 이력, 발효일자(effective date), 승인 상태에 대한 개념이 존재하지 않습니다.

설명 가능성은 규제 요구사항입니다. 21 CFR Part 11 및 GxP 규정에 따르면, 특정 문서가 검색된 이유를 명확히 설명할 수 있어야 합니다. “코사인 유사도가 0.82입니다”라는 설명은 규제 감사관에게 유효한 답변이 될 수 없습니다. 개념 수준의 추적성(concept-level traceability)이 필수적입니다.

CRAG 벤치마크(NeurIPS 2024)는 이 문제를 수치로 입증했습니다. 최첨단(SOTA) RAG 솔루션조차 **환각(hallucination) 없이 답변하는 비율은 63%**에 불과했습니다. GxP 환경에서 나머지 37%는 고스란히 규제 위반으로 이어집니다.


아키텍처별 직접 비교

비교 항목 표준 RAG 하이브리드 RAG Graph RAG 에이전틱 RAG
단일 홉(Single-hop) 정확도 60-70% 80-90% 75-85% 검색기에 따라 상이
다중 홉(Multi-hop) 정확도 미흡 (Poor) 미흡 (Poor) 80-85% 우수 (Strong)
정확한 용어 매칭 취약 (Weak) 탁월 (Excellent) 우수 (Good) 상황에 따라 상이
감사 가능성 (Auditability) 미흡 (Poor) 우수 (Good) 탁월 (Excellent) 낮음 (비결정론적 특성)
지연 시간 (Latency) <100ms 100-300ms 2-4초(로컬), 5-10초(글로벌) 3-10초
인덱싱 비용 (100만 토큰당) ~$0.10 ~$0.15-0.30 $30-80 질의당 LLM 비용 발생
구축 복잡도 (Setup complexity) 낮음 낮음-보통 높음 높음
유지 관리 부담 낮음 낮음 높음 (그래프 드리프트) 높음
GxP 밸리데이션 적합성 보통 높음 높음 낮음

출처: Michigan State / Meta (arXiv:2502.11371, 2025년 2월), AppScale 2026 분석, CRAG 벤치마크 (NeurIPS 2024).


논쟁을 종식시킨 벤치마크

2025년 2월, 미시간 주립대학교(Michigan State University)와 메타(Meta)는 널리 쓰이는 데이터셋을 기반으로 RAG와 GraphRAG를 체계적으로 평가한 최초의 연구 논문을 발표했습니다(arXiv:2502.11371). 그 주요 연구 결과는 다음과 같습니다:

단일 홉 질의에서는 RAG가 승리합니다. 정답이 주로 단일 청크나 한 문서에 존재하는 경우, 벡터 검색이 훨씬 빠르고 저렴하며 정확했습니다(단일 홉 QA에서 68.73%의 정확도 달성).

다중 홉 질의에서는 GraphRAG가 압도합니다. 여러 문서에 걸쳐 있는 사실들을 조합해야 하는 질의 — “장비 X의 일탈로 인해 어떤 CAPA가 유발되었으며, 그 결과 어떤 SOP가 개정되었는가?” — 에서는 GraphRAG가 3배 더 높은 정확도를 기록했습니다.

둘은 경쟁 관계가 아닌 상호보완적 관계입니다. 해당 논문에서는 두 가지 통합 전략을 테스트했습니다: (1) 선택(Selection) — 질의의 특성에 따라 RAG 또는 GraphRAG로 동적 라우팅; (2) 통합(Integration) — 두 가지 방식을 결합. 두 전략 모두 어느 단일 방식보다 뛰어난 성능을 보였습니다.

이것이 핵심 통찰입니다: “어느 것이 더 우수한가”가 아니라 “어떤 질의 유형에 어떤 방식을 적용할 것인가”가 올바른 질문입니다.


실제 벤더의 구현 사례: 마스터컨트롤(MasterControl)의 지식 그래프 접근법

ISO 42001 인증을 획득하고 연간 반복 매출(ARR) 2억 달러 및 1,100여 개 이상의 고객사를 보유한 마스터컨트롤(MasterControl)은 2025년 5월 프로덕션 환경에서의 접근 방식을 공개했습니다. 이는 규제 대상 소프트웨어 벤더가 공개한 가장 상세한 공개 기술 자료입니다:

아키텍처: 모든 규제 문장을 주어-술어-목적어(SPO, Subject-Predicate-Object) 트리플렛으로 분해합니다. 이 트리플렛과 원본 텍스트를 벡터로 함께 저장합니다. 파이프라인은 다중 에이전트 구조로 운영됩니다: 수집(Ingestion) → 추출(Extraction) → 정제(Cleaning) → 인덱싱(Indexing) → 검색(Retrieval) → 스토리 빌더(Story Builder).

주요 성과:

  • 사실 정확도(Factual accuracy): 기준 진실(ground-truth) 평가에서 5.0점 만점 중 4.7점 기록
  • 엄격한 임계값(0.75)에서의 섹션 중복도(Section overlap): 트리플렛 미적용 시 0.168 vs 트리플렛 적용 시 0.289
  • 인용 네트워크로는 연결할 수 없었던 5,014개 섹션 중 5,011개를 트리플렛 네트워크가 성공적으로 연결
  • 평균 최단 경로: 인용 네트워크의 2.02홉 대비 트리플렛 네트워크에서 1.33홉으로 단축

핵심 설계 결정: 온톨로지 프리(ontology-free) 방식을 채택했습니다. 사전에 경직된 온톨로지를 강제하는 대신 패턴이 유기적으로 드러나도록 두고, 필요한 경우에만 구조를 추가합니다. 이를 통해 수집 속도를 빠르게 유지하고 유지보수 비용을 낮추면서도, 추후 구조화된 추론을 가능하게 만듭니다.

규제 준수에서 가장 중요한 기능: 대화형 서브그래프 뷰(Interactive subgraph views)입니다. 시스템이 답변을 생성할 때, 근거로 사용한 규칙들의 미니그래프를 시각화하여 함께 표시합니다. 사용자는 클릭하여 각 출처를 직접 검증할 수 있습니다. 블랙박스에 대한 맹목적인 신뢰를 요구하지 않습니다.


비용의 현실

Graph RAG는 결코 저렴하지 않습니다. AppScale의 2026년 분석에 따른 비용 데이터는 다음과 같습니다:

구성 요소 비용
벡터 임베딩 (text-embedding-3-small) 100만 토큰당 ~$0.10
하이브리드 RAG (벡터 + BM25 + 리랭커) 100만 토큰당 ~$0.15-0.30
GraphRAG 인덱싱 (마이크로소프트, gpt-4o-mini) 100만 토큰당 $30-80
GraphRAG 인덱싱 (마이크로소프트, gpt-4-turbo, 2024년 가격 기준) 100만 토큰당 $1,500-3,000

GraphRAG 인덱싱은 단순 벡터 임베딩에 비해 300배에서 1,000배 더 비쌉니다. 질의당 처리 비용의 경우 로컬 검색(local search)은 유사한 수준이지만, 계층 구조의 각 커뮤니티마다 LLM을 호출하고 맵리듀스(map-reduce)로 팬아웃하는 글로벌 검색(global search)에서는 비용이 급격히 증가합니다.

GraphRAG 도입을 결정하는 트리거(Trigger): 하이브리드 검색 튜닝과 리랭커 캘리브레이션을 모두 마쳤음에도 불구하고, 평가 결과 다중 홉 질의 하위 집합에서 15~25%의 오탐률(false-negative rate)이 지속적으로 발생할 때입니다. 바로 그 시점이 GraphRAG를 도입해야 하는 신호입니다. 그 이전에는 도입해서는 안 됩니다. 검색 정확도를 개선하겠다며 성급하게 GraphRAG를 제안하는 대다수의 팀들은 훨씬 저렴하고 간단한 작업 — 즉 BM25 튜닝과 리랭커 최적화 — 을 건너뛰고 있으며, 사실 그 작업만으로도 목표 개선치의 70%를 달성할 수 있습니다.


CRAG 계층: 환각을 차단하는 방화벽

5건의 분석 모두 규제 환경에서 검색 품질 평가(retrieval-quality evaluation) 체계가 필수적이라고 한목소리로 지적했습니다. 가장 실용적인 구현 방식은 교정 RAG(CRAG, Corrective RAG)입니다:

  1. 문서를 정상적으로 검색합니다 (하이브리드 RAG)
  2. 채점기(Grader)가 평가합니다: 검색된 청크들이 실제로 질문에 대한 답을 포함하고 있는가?
  3. 답을 포함하고 있다면 → 출처 인용과 함께 답변 생성 진행
  4. 답을 포함하고 있지 않다면 → 응답 거부: “승인된 문서 내에서 관련 답변을 찾을 수 없습니다.”

이 패턴은 GxP AI 시스템에서 가장 치명적인 실패 모드, 즉 ’그럴듯하게 들리는 그릇된 답변을 확신에 차서 내놓는 문제’를 원천 차단합니다. 규제 환경에서는 환각으로 지어낸 가짜 SOP 인용을 제공하는 것보다 차라리 “답을 알 수 없습니다”라고 응답하는 편이 언제나 훨씬 안전합니다.

CRAG 벤치마크(NeurIPS 2024)에 따르면 최신 LLM 대부분은 RAG 없이는 34% 이하의 정확도를 보입니다. 표준 RAG를 추가해도 정확도는 44%로 소폭 상승할 뿐입니다. 반면 교정 메커니즘을 갖춘 최첨단 RAG는 환각 없이 63%의 정확도에 도달합니다. 63%와 100% 사이의 이 격차가 바로 전문가에 의한 사람의 검토(human review)가 여전히 필수적인 이유입니다.


단계별 아키텍처: 무엇을 언제 구축해야 하는가

모든 분석은 단계적 접근 방식(phased approach)으로 수렴했습니다. 그 종합된 로드맵은 다음과 같습니다:

1단계 (1~8주 차): 하이브리드 RAG + 메타데이터 필터링 + CRAG

Query (질의 입력)
  → Metadata Filter (status=approved, effective_date ≤ today, 사용자 RBAC)
  → Query Rewriting (약어 확장, 문서 코드 정규화)
  → Hybrid Retrieval (밀집 벡터 + BM25 희소 검색)
  → Cross-Encoder Reranker (BGE 또는 Cohere)
  → CRAG Relevance Gate (신뢰도가 낮은 검색 결과 거부)
  → Generation with strict citation (엄격한 인용 기반 생성: 모든 주장 → 소스 청크 + 페이지/섹션 명시)
  → Attribution Validator (모든 인용문이 실제 검색된 컨텍스트에 존재하는지 검증)

이 방식이 효과적인 이유: 일상적인 품질 관련 질의의 80%를 처리할 수 있습니다. 벡터 검색이 “HPLC 검체의 보관 시간(hold time)은 얼마인가”라는 의미를 파악하는 동안, BM25는 “SOP-QC-015 Rev 3”과 같은 고유 식별 코드를 정확하게 잡아냅니다. 또한 CRAG 게이트는 환각된 답변이 사용자에게 노출되는 것을 사전에 차단합니다. 각 모듈은 독립적으로 테스트 및 밸리데이션이 가능합니다.

벤치마크 기대치: 단순 Naive RAG 대비 검색 오류 3560% 감소. 단일 홉 질의에 대해 8090%의 높은 정확도 달성.

2단계 (3~6개월 차): 문서 수준 그래프(Document-Level Graph) 추가

초기부터 과도하게 엔티티 수준(entity-level)의 심층 지식 그래프를 구축하려 들지 마십시오. 이미 QMS(품질경영시스템) 내에 명시적으로 존재하는 링크들을 매핑하는 문서 수준의 그래프부터 시작하십시오:

  • 노드(Nodes): 문서 (SOP, CAPA, 일탈, 변경 관리, 규격서, 제조기록서)
  • 관계(Relationships): references (참조함), supersedes (대체함), triggered_by (유발됨), approved_by (승인됨), applies_to (적용됨)
  • 버전 엣지(Version edges): SOP-001 v2 → SOP-001 v3 (supersedes)

이 그래프를 하이브리드 검색과 병행하는 보조 검색 채널로 활용하십시오. 관계 탐색이 수반되는 질의(“장비 X의 일탈로 인해 어떤 CAPA가 유발되었는가?”)는 그래프로 라우팅합니다. 특정 문서 내용에 대한 질의(“SOP-QA-007의 무균 작업복 착용 규정은 무엇인가?”)는 하이브리드 검색으로 라우팅합니다.

문서 수준 그래프를 먼저 구축해야 하는 이유: 수만 페이지에 달하는 레거시 SOP에서 모든 명사와 동사를 일일이 추출하는 불가능에 가까운 작업 없이도 Graph RAG의 강력한 추적 성능을 온전히 활용할 수 있습니다. QMS에는 이미 연결 고리가 마련되어 있습니다. CAPA 기록은 SOP를 참조하고, 일탈 보고서는 장비를 명시하며, 변경 관리는 관련 문서를 지정합니다. 여러분이 할 일은 이미 존재하는 이러한 링크들을 쿼리 가능한 형태로 만드는 것뿐입니다.

3단계 (6~12개월 차): 엔티티 수준 그래프 + 에이전틱 라우팅

본격적인 엔티티 지식 그래프를 확장 구축합니다:

  • 엔티티(Entities): 장비, 작업자, 제품, 규제 조항, 교육 훈련 기록
  • 엔티티 수준 관계: “작업자 A는 SOP-007 교육을 이수함”, “장비 X는 Y 일자에 교정(calibration)됨”

경량화된 에이전틱 라우팅 계층을 추가합니다:

  • 단순 사실 확인 질의 → 하이브리드 RAG (빠르고 저렴함)
  • 관계 추적 질의 → Graph RAG (정확하고 감사 가능함)
  • 복합 종합 질의 → 가드레일이 적용된 에이전틱 RAG (사전 승인된 출처만 참조, 전체 감사 로그 기록)

안전 가드레일: 에이전틱 RAG는 내부 탐색 및 문서 초안 작성 용도로만 제한되어야 하며, 사람의 검토 없이 최종 GxP 의사결정에 직결되어서는 안 됩니다. 동일한 질의에 대해 매번 다른 검색 경로를 탈 수 있는 비결정론적 특성(non-determinism)은 21 CFR Part 11 기준의 밸리데이션을 매우 어렵게 만듭니다.

4단계 (향후 로드맵): Self-RAG 및 고급 검증 체계

가장 위험도가 높은 중요 산출물에 대해 자체 성찰(self-reflection) 메커니즘을 도입합니다:

  • 규제 당국 제출용 문서 초안
  • 감사 실사 대응 문서
  • 정기 실사 준비 패키지

Self-RAG의 성찰 토큰(reflection tokens)은 생성된 출력물의 모든 주장이 검색된 증거에 의해 뒷받침되는지 엄격히 검증합니다. 단, 추론 비용이 2~3배 증가하고 별도의 모델 파인튜닝이 필요하다는 점을 고려해야 합니다.


의사결정 프레임워크

주요 활용 사례(Use Case)가 다음과 같다면… 우선 이것으로 시작하십시오… 이후 다음을 추가하십시오…
SOP, 정책, 가이드라인 문서 검색 하이브리드 RAG + 메타데이터 필터링 개정 이력 관리를 위한 문서 그래프
근본 원인 분석, CAPA 조사, 일탈 트렌드 분석 하이브리드 RAG + 문서 수준 그래프 엔티티 그래프 + 에이전틱 라우팅
규제 당국 제출 문서 및 실사 대응 초안 작성 하이브리드 RAG + CRAG 검증 증거 검증을 위한 Self-RAG
다중 규제 프레임워크 간 갭 분석(Gap analysis) 에이전틱 RAG (내부 분석 전용) 상호 참조 매핑을 위한 지식 그래프
직원 교육 및 온보딩 (GxP 비임계 영역) 하이브리드 RAG 추가 구성 불필요

품질 보증(QA) 팀에 반드시 전달해야 할 핵심 사항

어떤 아키텍처를 선택하든, GxP 프로덕션 환경에 배포하기 위해서는 다음 원칙들이 반드시 충족되어야 합니다:

  1. 감사 추적(Audit trails). 모든 검색 과정에서 어떤 문서가 검색되었는지, 어떤 질의 문장이 사용되었는지, 요청한 사용자가 누구인지 기록되어야 합니다. 시스템은 검색된 구체적인 문서 청크와 검색을 유발한 핵심 개념을 명확히 제시해야 합니다.

  2. 접근 제어 권한 상속(Access control inheritance). 사용자가 QMS 시스템에서 특정 CAPA 원본 문서를 열람할 권한이 없다면, RAG 답변에서도 해당 문서의 내용을 볼 수 없어야 합니다. 역할 기반 접근 제어(RBAC)는 문서 수준에서 검색 실행 전 사전에 엄격히 적용되어야 합니다.

  3. 버전 인식 검색(Version-aware retrieval). 품질 문서는 지속적으로 개정됩니다. 검색 엔진은 발효일자와 문서 버전을 엄격히 준수해야 합니다. 그래프 구조가 이를 관리하는 데 유리하지만, 하이브리드 RAG의 메타데이터 필터링만으로도 이 요구사항의 80%를 해결할 수 있습니다.

  4. 신뢰도 채점 및 답변 거부(Confidence scoring and abstention). 시스템은 불확실한 상태에서 억지로 추측하는 대신 “질문에 답하기 위한 충분한 정보가 없습니다”라고 말할 수 있어야 합니다. 이것이 바로 CRAG 패턴의 핵심 가치입니다.

  5. 인간 참여(Human-in-the-loop). RAG 시스템은 적격한 인원(Qualified Person)의 검토 업무를 보조하는 도구일 뿐, 사람을 대체하지 않습니다. 2026년 4월 2일 자 푸롤레아(Purolea) 경고 서한(Warning Letter)은 이 점을 명확히 규정했습니다.

  6. 컴퓨터 시스템 밸리데이션(IQ/OQ/PQ). RAG 시스템이 생성한 콘텐츠가 GxP 관련 의사결정에 사용된다면 해당 시스템은 규제 대상 컴퓨터 시스템에 해당합니다. 각 모듈을 독립적으로 밸리데이션해야 하며, 모듈러 RAG 아키텍처를 도입하면 이러한 밸리데이션 작업을 현실적으로 관리 가능한 수준으로 단순화할 수 있습니다.


요약 및 결론

하나의 RAG 아키텍처만을 고집하지 마십시오. 단계별 계층 구조로 구축하십시오.

하이브리드 RAG로 시작하십시오. 일상적인 품질 질의의 80%를 안정적으로 처리하며, 밸리데이션이 명확하고, 표준 RAG와 비교해 추가 비용이 거의 들지 않습니다. 버전 관리와 문서 승인 상태를 강제하기 위해 메타데이터 필터링을 추가하고, 환각된 답변이 사용자에게 전달되는 것을 차단하기 위해 CRAG 평가 계층을 도입하십시오.

평가 결과 다중 홉 질의에서 지속적으로 1525%의 실패율이 관찰될 때 비로소 Graph RAG를 추가하십시오. QMS가 이미 보유하고 있는 연결 고리를 활용하는 문서 수준 그래프부터 시작하고, 3001,000배에 달하는 인덱싱 비용 증가를 정당화할 수 있는 투자 대비 효과(ROI)가 입증될 때 비로소 엔티티 수준으로 확장하십시오.

복합적인 문서 분석 및 종합 작업에는 에이전틱 RAG를 추가하십시오. 단, 내부 탐색 용도로만 제한해야 하며 인적 검토 없는 GxP 의사결정에는 절대 사용해서는 안 됩니다. 비결정론적 특성은 규제 환경에서 아직 해결되지 않은 밸리데이션 과제입니다.

궁극적인 최종 상태의 아키텍처는 **CRAG 검증 체계를 갖춘 에이전틱 하이브리드 Graph RAG(Agentic Hybrid Graph RAG with CRAG validation)**입니다. 그러나 한 번에 구축하려 하지 말고 각 계층을 GxP 기준에 맞게 단계별로 밸리데이션하면서 점진적으로 완성해 나가십시오. 2026년에 성공적으로 안정적인 RAG 시스템을 구축하는 팀들은, 아키텍처를 먼저 선택하기에 앞서 실제 워크로드와 질의 유형을 먼저 철저히 측정한 팀들입니다.


벤치마크 표, 상세 비용 분석, MasterControl 지식 그래프 아키텍처 심층 분석이 포함된 전체 연구 보고서는 [[RAG Architecture Comparison for Life Sciences Quality Documents - Multi-LLM Consensus]] 문서를 참조하십시오.

참고 문헌: Han et al., arXiv:2502.11371 (Michigan State / Meta, 2025년 2월). CRAG Benchmark, NeurIPS 2024. MasterControl, “RAGulating Compliance With GenAI,” 2025년 5월. AppScale, “GraphRAG vs Vector RAG vs Hybrid: 2026 Multi-Hop Retrieval Architecture Guide.” FDA/EMA 인공지능 우수 실무 공동 원칙(Joint Guiding Principles of Good AI Practice), 2026년 1월 14일. ISPE GAMP AI 가이드, 2025년 7월.