아홉 명의 전문가에게 동일한 질문을 던졌습니다. 생명과학 품질 조직이 AI 에이전트를 위해 Google의 Open Knowledge Format(OKF)을 도입해야 할까요?

서로 판이하게 다른 아홉 개의 분석 결과가 나왔습니다. 하지만 수사적 표현을 걷어내고 실제 아키텍처 권장 사항들을 비교해 보면 놀라운 사실이 드러납니다. 아홉 곳 모두가 정확히 동일한 설계로 수렴했다는 점입니다. 이견은 목적지에 관한 것이 아니었습니다. 어떤 경로를 선택해야 하는지, 그리고 어느 길이 함정인지에 관한 것이었습니다.

그 투표 결과를 종합하면 다음과 같습니다.

9가지 평결 종합 분석 (The verdicts, scored)

# 입장 (Position) 권장 사항 (Recommendation)
1 조건부 찬성 (Pro with caveats) 밸리데이션된 시스템과 동기화되고 주기적으로 재생성되는 읽기 전용 지식 계층
2 발전된 찬성 (Pro, evolved) 권위 있는 시스템(authoritative systems)에서 파생되어 지속적으로 재생성되는 AI 네이티브 지식 객체(Knowledge Object) 계층
3 조건부 찬성 (Pro, conditional) 읽기 전용 파생 지식 교환 계층으로서의 엄격히 규제된 OKF 프로필
4 조건부 찬성 (Pro, conditional) 상위에 규제 준수 계층을 둔 내부 표현 방식으로서의 OKF
5 재정의된 찬성 (Pro, reframed) 저장된 파일이 아닌 동적 API 응답 포맷으로서의 임시(Ephemeral) OKF
6 신중한 찬성 (Pro, cautious) 읽기 전용 시맨틱 인덱스, 절대 공식 기록 시스템(system of record)으로 사용 금지
7 격리 전제 찬성 (Pro, quarantined) 규제 대상 외 지식에만 OKF 적용; 밸리데이션된 QMS와의 방화벽 구축
8 반대 성향 (Anti-leaning) 저장소가 아닌 임시 프로젝션(ephemeral projection); 엄격한 스키마; 복사본이 아닌 링크
9 반대 성향 (Anti-leaning) 읽기 전용 섀도우 볼트(shadow vault); QMS 데이터베이스가 유일한 진실의 원천(sole source of truth)으로 유지

결과: 9명 중 9명 전원이 근본적인 아키텍처에 동의했습니다. 밸리데이션된 QMS가 진실의 원천(source of truth)으로 남습니다. 파생되고 지속적으로 재생성되는 읽기 전용 계층이 AI 에이전트에게 구조화된 컨텍스트를 제공합니다. 파생 계층을 수작업으로 편집하는 사람은 아무도 없습니다. 그 안의 모든 문서는 권위 있는 원본 소스를 다시 가리킵니다.

9명 중 eQMS의 대체재로 OKF를 채택하라고 권장한 사람은 단 한 명도 없었습니다(0명). 또한 구조화된 지식 표현을 완전히 포기하고 PDF에 대한 단순 RAG만 사용하라고 권장한 사람도 단 한 명도 없었습니다(0명).

모두가 동의한 사항

작성자가 찬성 성향이든 반대 성향이든 관계없이 모든 분석에서 공통적으로 세 가지 핵심 사항이 나타났습니다:

1. 기저에 깔린 핵심 통찰은 옳습니다. 생명과학 분야의 AI 에이전트에는 조각난 PDF에 대한 단순 벡터 유사도 검색이 아니라 관계가 명시적으로 연결된 구조화된 지식이 필요합니다. 품질 조사 업무에서는 그래프 탐색(graph traversal)이 시맨틱 검색보다 훨씬 우수합니다. 상호 참조와 추적성(traceability)이 핵심입니다. 이 점에 대해서는 그 누구도 이견을 제기하지 않았습니다.

2. 밸리데이션된 시스템이 반드시 진실의 원천으로 유지되어야 합니다. 21 CFR Part 11, EU Annex 11, 그리고 ALCOA+ 데이터 완전성 원칙은 타협의 대상이 아닙니다. 전자 서명, 불변의 감사 추적(immutable audit trails), 접근 제어, 변경 관리는 eQMS 내에서 이루어져야 합니다. Git 리포지토리에 저장된 마크다운 파일은 통제된 문서(controlled document)가 아닙니다. 이 점 역시 전혀 논쟁거리가 되지 않았습니다.

3. 파생된 지식 계층이 올바른 패턴입니다. 밸리데이션된 시스템과 AI 에이전트 사이에는 무언가가 위치해야 합니다. 즉, 여러 사일로 시스템 전반에서 컨텍스트를 취합하고 관계를 보존하며 지식을 에이전트가 활용 가능한 형태로 가공해 주는 프로젝션(투영 계층)이 필요합니다. 쟁점은 항상 그 계층이 어떤 형태를 취해야 하는가였지, 그 계층이 존재해야 하는가 자체가 아니었습니다.

실제 이견이 존재했던 지점

의견 차이는 아키텍처에 대한 것이 아니었습니다. 두 가지 구체적인 구현 방식에 관한 질문에서 비롯되었습니다:

파생 계층은 영속적이어야 하는가, 아니면 임시적(휘발성)이어야 하는가?

분석의 절반은 영속적(persistent) 계층(시간이 지나도 유지 관리되는 Git 리포지토리, 지식 그래프 데이터베이스, 시맨틱 인덱스)을 선호했습니다. 나머지 절반은 임시적(ephemeral) 계층(실시간 QMS로부터 온디맨드로 재생성되며 장기 저장되지 않는 형태)을 지지했습니다. 영속성을 지지하는 진영은 교차 참조, 관계 매핑, 보강된 메타데이터 등 축적된 지식이 복리적 가치를 지닌다고 주장했습니다. 반면 임시성을 지지하는 진영은 어떠한 영속적 사본이라도 원본 소스로부터 필연적으로 괴리(drift)가 발생하며 데이터 완전성 리스크를 유발한다고 반박했습니다.

대부분의 분석이 최종적으로 도달한 해답은 **‘영속적 인덱스, 임시적 콘텐츠(persistent index, ephemeral content)’**였습니다. 메타데이터와 관계는 영속적 그래프로 유지될 수 있습니다(이들은 변경 빈도가 낮고 QMS 스키마로부터 결정론적으로 도출되기 때문입니다). 반면 문서 콘텐츠는 실시간으로 호출되거나 빈번하게 갱신되어야 합니다(콘텐츠는 자주 변경되며, 정보의 노후화는 규제 준수상의 치명적인 리스크이기 때문입니다).

포맷은 마크다운이어야 하는가, 아니면 구조화된 데이터여야 하는가?

OKF 찬성파는 YAML 프론트매터가 포함된 마크다운이 사람이 읽기 쉽고(human-readable), 에이전트가 파싱하기 좋으며(agent-parseable), diff 비교가 가능하고 이식성이 높다고 주장했습니다. 반면 OKF 반대파는 마크다운이 지나치게 자유도가 높아 스키마 강제성이 부족하며, QMS 플랫폼이 이미 제공하고 있는 구조화된 데이터베이스로부터의 퇴보라고 반박했습니다.

업계가 이미 구현 중인 해답은 **‘구조화된 데이터 기반, 마크다운은 선택적 렌더링 계층으로 활용’**하는 것입니다. Veeva Direct Data API는 완전한 스키마 메타데이터를 포함한 구조화된 CSV를 내보냅니다. MCP는 구조화된 JSON 응답을 제공합니다. 에이전트에게 필요한 것은 마크다운이 아닙니다. 명시적인 관계를 가진 구조화된 데이터입니다. 사람이 읽을 수 있는 렌더링이 필요하다면 구조화된 데이터로부터 즉시 생성하면 되며, 이를 기본 저장 포맷으로 삼을 필요는 없습니다.

업계가 실제로 구축하고 있는 것

이러한 논쟁이 진행되는 동안, QMS 벤더들과 AI 플랫폼 제공업체들은 조용히 진정한 해결책을 구축하고 있었습니다. 지난 12개월간 나타난 세 가지 발전은 그 어떤 규격서나 블로그 글보다 훨씬 중요한 의미를 갖습니다:

Veeva Direct Data API (2025). Vault 플랫폼에 무료로 기본 포함됩니다. 기존 API 대비 최대 100배 빠릅니다. 15분 주기 일정으로 전체, 증분 및 로그 데이터 파일을 내보냅니다. GitHub에 Snowflake, Databricks, Redshift, Azure SQL용 오픈소스 액셀러레이터가 공개되어 있습니다. 생명과학 분야 최대의 QMS 벤더가 마크다운으로 내보내는 방식이 아니라, 높은 처리량으로 구조화된 데이터 모델을 제공함으로써 API 계층에서 데이터 접근성 문제를 해결하고 있는 것입니다.

Veeva와 Snowflake의 파트너십 (2026년 5월). Veeva Vault용 Snowflake Openflow 커넥터를 통해 읽기 전용 Veeva 데이터가 Snowflake AI Data Cloud로 유입됩니다. 보도자료는 “밸리데이션된 문서는 그대로 온전히 유지되면서 Snowflake의 안전한 환경으로 통합된다”고 명시하고 있습니다. 이것이 바로 밸리데이션된 커넥터를 통해 플랫폼 수준에서 구현된 ‘파생된 읽기 전용 계층’ 패턴입니다. 마크다운도 없고, Git도 없습니다. 공식 기록 시스템에서 분석 및 AI 계층으로 흘러 들어가는 구조화된 데이터만 존재합니다.

MCP — Model Context Protocol (2025-2026). Anthropic이 개발하고 OpenAI, Google, Microsoft, AWS가 채택했습니다. 5,000개 이상의 활성 MCP 서버가 운영 중입니다. 생명과학 규제 준수 컨설팅 기업인 USDM은 MCP를 “규제 환경을 위한 AI 통합 계층”으로 포지셔닝하고 있습니다. Anthropic 파트너인 Deepsense.ai는 헬스케어 및 생명과학을 위한 프로덕션급 MCP 서버를 구축하고 있습니다. 이 프로토콜을 통해 AI 에이전트는 완전한 감사 추적과 접근 제어를 유지하면서 실시간 API를 대상으로 도구를 호출할 수 있습니다(get_effective_version("SOP-00123"), list_open_capas("Product-A"), search_deviations("Equipment-442", last_n_months=24) 등).

이 세 가지 발전은 아홉 개의 분석 모두가 도달한 아키텍처를 하나로 보여줍니다:

Validated QMS (Veeva Vault)
  ↓  Direct Data API / MCP connectors (read-only, 15-min refresh)
Data Integration Layer (Snowflake / semantic index)
  ↓  Dynamic knowledge graph from QMS metadata
  ↓  Vector embeddings from document content
AI Agent Layer (MCP tool-use, function calling)
  ↓  Full retrieval audit trail
Human Decision (with source citations)

마크다운 파일도, Git 리포지토리도, 병렬 문서 포맷도 없습니다. 지식 표현은 데이터 웨어하우스와 MCP 도구 정의 내에 존재합니다. 그래프는 QMS 메타데이터로부터 동적으로 구축됩니다. 에이전트는 시간에 민감한 데이터에 대해 실시간 API를 호출합니다.

OKF가 옳았던 점 — 그리고 나아갈 방향

포맷 자체는 규제 환경을 위한 궁극적인 해답이 아니었을지라도, 이번 논의에 대한 OKF의 기여는 실질적이었습니다. OKF가 제시한 세 가지 핵심 개념은 현재 업계가 구축 중인 아키텍처에 깊이 내재화되어 있습니다:

파일당(또는 레코드당) 하나의 개념. 방대한 단일 문서에 지식을 묻어두는 것이 아니라, 개별적이고 자체 설명적인(self-describing) 엔티티를 중심으로 지식을 구성해야 한다는 원칙은 QMS 데이터 모델의 작동 방식과 정확히 일치합니다. 일탈(Deviation)은 하나의 레코드입니다. CAPA도 하나의 레코드입니다. SOP 버전도 하나의 레코드입니다. 각각은 구조화된 메타데이터와 다른 레코드들과의 관계를 지니고 있습니다.

구조화된 메타데이터로서의 YAML 프론트매터. 모든 지식 단위가 쿼리 가능한 메타데이터(유형, 상태, 버전, 유효일자, 태그 등)를 수반해야 한다는 개념은 이제 모든 QMS 데이터 모델의 표준입니다. Veeva의 Direct Data API는 바로 이러한 구조화된 메타데이터를 콘텐츠와 함께 내보냅니다.

그래프로서의 상호 링크(Cross-links). 개념 간의 관계가 암시적이 아니라 명시적이어야 한다는 원칙은 생명과학 분야의 모든 지식 그래프 구현의 기초입니다. 유일한 차이점은 업계가 이러한 그래프를 마크다운 링크가 아니라 QMS 데이터베이스의 관계로부터 구축한다는 점입니다.

OKF는 이러한 개념들을 하나의 규격(spec)으로 공식화했습니다. 그리고 업계는 이를 API, 데이터 웨어하우스, 에이전트 프로토콜을 통해 구현해 나가고 있습니다. 해당 규격은 훌륭한 사고의 도구(thinking tool) 역할을 했습니다. 다만 실제 구현 경로는 완전히 다른 인프라를 통해 진행되고 있습니다.

솔직한 최종 평결

오늘날 생명과학 품질 관리를 위한 AI 에이전트를 구축하고 있다면, 9개 분석의 수렴 결과와 벤더들이 실제로 출시하고 있는 기술들이 시사하는 바는 다음과 같습니다:

마크다운 지식 베이스를 구축하지 마십시오. 밸리데이션 부담은 현실이고, 데이터 괴리(drift) 위험도 명백하며, 벤더들은 병렬 문서 포맷을 별도로 유지할 필요가 없는 계층에서 이미 문제를 해결하고 있습니다.

단순히 벡터 데이터베이스에 PDF만 쏟아붓지 마십시오. 청크로 쪼갠 문서에 대한 순수 RAG는 관계 정보를 상실하고 버전 관리를 놓치며 문서 ID를 제대로 구분하지 못합니다. 단순한 시맨틱 유사도가 아니라 구조화된 메타데이터와 명시적인 관계가 반드시 필요합니다.

밸리데이션된 시스템과의 커넥터에 투자하십시오. Veeva의 Direct Data API는 무료이며 빠릅니다. MCP는 광범위한 벤더 지원을 받는 개방형 프로토콜입니다. 자체 제작한 커스텀 내보내기 파이프라인이 아니라 이러한 표준 기반 위에 AI 계층을 구축하십시오.

QMS 메타데이터로부터 동적 지식 그래프를 구축하십시오. QMS 데이터베이스 내의 관계(일탈 → CAPA → SOP → 장비 → 밸리데이션)는 이미 구조화되어 있습니다. 이를 쿼리 시점에 에이전트가 탐색할 수 있는 그래프로 추출하십시오. 마크다운으로 중복 복제하지 마십시오.

시간에 민감한 데이터는 에이전트가 실시간 API를 반드시 호출하도록 강제하십시오. 승인 상태, 유효 버전, 교육 이수 상태 등은 빈번하게 변경됩니다. 에이전트는 15분 전 정보일 수 있는 캐시를 읽는 대신 실시간 QMS를 대상으로 get_effective_version()을 직접 호출해야 합니다.

규제 준수를 위해 모든 검색(retrieval) 내역을 로깅하십시오. MCP의 구조화된 메시지 포맷은 자연스러운 감사 지점(audit points)을 제공합니다. 모든 도구 호출, 모든 API 응답, 접근한 모든 문서에 타임스탬프가 찍히고 귀속성(attributable)이 보장됩니다.

OKF의 이면에 있는 패턴(명시적 지식, 연결된 개념, 구조화된 메타데이터, 그래프 탐색)은 규제 환경의 AI를 위한 올바른 패턴입니다. 포맷은 이를 명확히 표현하기 위한 유용한 방법이었습니다. 하지만 업계에 필요한 실질적인 구현체는 이미 구축되고 있으며, 이는 마크다운 파일 디렉터리가 아니라 API, 데이터 웨어하우스, 에이전트 프로토콜을 통해 실현되고 있습니다.

9가지 평결은 아키텍처에 대해 모두 동의했습니다. 벤더들은 인프라를 구축하고 있습니다. 이제 남은 질문은 기업과 조직들이 밸리데이션된 시스템을 AI가 활용할 수 있도록 해주는 커넥터와 지식 그래프 계층에 투자할 것인가, 아니면 벡터 데이터베이스에 PDF를 계속 집어넣으면서 청크들이 우연히 잘 들어맞기만을 바랄 것인가 하는 점뿐입니다.


Veeva Direct Data API: developer.veevavault.com/directdata. Snowflake + Veeva 파트너십: snowflake.com/blog/snowflake-veeva-agentic-ai-life-sciences. 생명과학을 위한 MCP: usdm.com/resources/blogs/the-model-context-protocol-mcp-in-life-sciences. ISPE GAMP AI 가이드: ispe.org.

관련 기사