품질 관리자가 시스템에 다음과 같이 질의합니다: “지난 2년간 장비 ID-442와 관련된 일탈(Deviation)에서 시작된 시정 및 예방조치(CAPA)는 무엇이며, 그것들이 효과적이었습니까?”
시스템은 다음 경로를 순차적으로 탐색(traverse)해야 합니다: 일탈 보고서 → 해당 일탈과 연결된 장비 적격성평가(Qualification) → 관련 세척 밸리데이션(Cleaning Validation) 프로토콜 → 표준작업지침서(SOP) → 규제 기관 지적 사항 이후 최신 버전으로 대체(superseded)된 내역 → 이로 인해 생성된 CAPA → CAPA가 촉발한 변경 관리(Change Control) → 최종적으로 업데이트된 위험 평가(Risk Assessment).
어떤 벡터 데이터베이스도 이 작업을 수행할 수 없습니다. 어떠한 임베딩 유사도 검색(embedding similarity search)도 이 연결 고리를 추적하지 못합니다. 이것은 본질적으로 그래프 탐색(graph traversal)이며, 대부분의 생명과학 조직이 갖추지 못한 지식 표현(knowledge representation) 체계를 필요로 합니다.
2026년 6월 12일, Google Cloud는 정확히 이러한 문제를 해결하기 위해 고안된 사양인 Open Knowledge Format(OKF) v0.1을 발표했습니다. 이 사양은 파편화된 메타데이터 속에서 어려움을 겪는 데이터 엔지니어링 팀을 위해 제작되었습니다. 그러나 해당 사양, 업계 환경, 그리고 품질 관리 시스템(QMS)의 특수한 아키텍처를 면밀히 분석한 결과 결론은 명확했습니다. 생명과학 품질 문서는 OKF가 본래 설계된 사용 사례보다 훨씬 더 강력하게 부합합니다. 단, 이 산업을 특별하게 만드는 규제 현실에 맞게 포맷을 조정하고, 포맷 자체가 완전히 잘못된 계층(layer)에 위치하는 지점을 정확히 이해해야 한다는 전제가 필요합니다.
본 가이드는 전체적인 그림을 종합적으로 제시합니다. OKF의 본질, 생명과학 분야가 더 적합한 이유, GxP에 맞춘 번들의 형태, 규제 마찰점이 발생하는 위치, 모든 분석이 수렴한 아키텍처, 그리고 기존 밸리데이션 완료 QMS를 바탕으로 이를 도입할 때 월요일 아침 출근 즉시 실행할 수 있는 실무 플레이북을 다룹니다.
OKF의 실제 본질
OKF는 의도적으로 단순하게 설계되었습니다. 지식 번들(knowledge bundle)은 마크다운 파일들로 이루어진 디렉터리입니다. 각 파일은 단일 개념(테이블, API, 지표, 플레이북 등)을 나타냅니다. 파일 경로 자체가 해당 개념의 고유 식별자(ID)가 됩니다. 상단의 YAML 프론트매터는 구조화된 메타데이터를 제공합니다. 본문은 마크다운 형식입니다. 파일 간의 교차 링크(cross-link)는 이 디렉터리를 하나의 그래프로 변환합니다.
---
type: SOP
title: Equipment Cleaning - Grade C/D Areas
description: Cleaning procedures for aseptic manufacturing equipment.
resource: https://veeva-vault.com/doc/00P123456
tags: [cleaning, aseptic, manufacturing]
timestamp: 2026-05-28T14:30:00Z
---
# Procedure
Standard cleaning procedure for equipment in Grade C and D
areas following [SOP-00123](/sops/SOP-00123-equipment-cleaning.md).
# Related Documents
- [Work Instruction WI-088](/work-instructions/WI-088.md)
- [Validation Protocol VP-234](/validation/VP-234.md)
- [21 CFR 211.67](/regulations/21-cfr-211.67.md)
이 사양에서 필수로 요구하는 필드는 오직 하나, type뿐입니다. 그 외의 모든 것은 선택 사항입니다. 이 포맷은 “단순한 파일(just files)“에 불과하므로 Git 리포지토리로 배포할 수 있고, 모든 텍스트 편집기에서 읽을 수 있으며, 별도의 SDK 없이도 모든 에이전트가 파싱할 수 있습니다. 파일을 cat 명령어로 볼 수 있다면 OKF를 읽을 수 있고, 리포지토리를 git clone할 수 있다면 이를 배포할 수 있습니다.
레퍼런스 구현체에는 BigQuery 데이터셋을 순회하며 모든 테이블과 뷰에 대한 개념 문서를 초안으로 작성하는 보강(enrichment) 에이전트와, 그래프를 렌더링하는 정적 HTML 시각화 도구가 포함되어 있습니다. 이제 Google Cloud의 Knowledge Catalog는 OKF 번들을 네이티브로 수집(ingest)할 수 있습니다.
이 포맷의 지적 계보는 안드레이 카파시(Andrej Karpathy)의 LLM Wiki 패턴으로 거슬러 올라갑니다. 즉, LLM이 큐레이션하고 하이퍼링크로 연결된 마크다운 파일 코퍼스를 조직이 아는 지식의 표준 표현(canonical representation)으로 취급하고, 연구자가 위키피디아를 탐색하듯 에이전트가 개념 간의 링크를 따라가며 지식을 탐색하게 만드는 방식입니다. 핵심 통찰은 LLM은 지루해하지 않고, 교차 참조 업데이트를 잊지 않으며, 한 번에 15개 이상의 파일을 동시에 수정할 수 있다는 점입니다. 지식 그래프를 유지 관리하는 고된 작업이야말로 언어 모델이 가장 뛰어난 역량을 발휘하는 영역입니다.
생명과학 분야가 더 잘 맞는 이유
Google은 데이터 팀을 위해 OKF를 구축했습니다. 대표적인 예시는 조인(JOIN) 경로와 지표 정의를 포함한 BigQuery 테이블입니다. 그것도 실제 존재하는 문제이지만, 범위가 매우 협소합니다.
생명과학 품질 문서는 OKF가 처리하도록 설계된 모든 요소를 갖추고 있으며, 그 이상입니다.
파편화가 훨씬 심각합니다. 데이터 팀의 메타데이터는 소수의 시스템에 분산되어 있습니다. 반면 품질 지식은 eQMS(Veeva Vault, MasterControl, TrackWise), LIMS, ELN, 밸리데이션 리포지토리, 규제 인텔리전스 데이터베이스, 공유 드라이브, 그리고 지난 20년간 이 업무를 수행해 온 베테랑 QA 전문가들의 머릿속에 나뉘어 존재합니다. “X 제품 배치 생산 후 반응기 용기를 세척하는 현재 승인된 방법은 무엇인가?“라는 질문에 답하려는 에이전트는 서로 대화하지 않는 5개 이상의 시스템에서 컨텍스트를 취합해야 합니다.
교차 참조가 훨씬 밀접합니다. 데이터 팀의 테이블은 외래 키(foreign key)를 통해 소수의 다른 테이블을 참조합니다. 반면 품질 SOP는 작업 지침서(WI), 장비 적격성평가, 밸리데이션 프로토콜, 규제 인용, 일탈 이력, CAPA 기록, 교육 훈련 매트릭스, 공급업체 문서 등을 참조합니다. 이러한 참조는 단순한 부모-자식 관계가 아닌, 8~12가지의 다양한 관계 유형으로 구성된 복잡한 그래프를 형성합니다.
위험과 책임(stakes)이 훨씬 높습니다. 에이전트가 데이터 테이블의 잘못된 버전을 가져오면 대시보드에 잘못된 숫자가 표시되는 것에 그칩니다. 하지만 에이전트가 일탈 조사 과정에서 대체되어 효력이 상실된 구버전 SOP를 가져오면, 조사는 폐기된 절차를 따르게 됩니다. 규제 환경에서 “거의 맞음”은 명백한 컴플라이언스 위반입니다.
기록 유지 관리의 고통이 훨씬 큽니다. SOP 하나가 개정되면 5개의 교육 문서, 2개의 양식, 3개의 작업 지침서, 그리고 밸리데이션 프로토콜 교차 참조 목록을 업데이트해야 할 수 있습니다. 품질 팀은 이러한 유지 관리에 수천 시간을 쏟아붓습니다. 에이전트는 바로 이러한 작업을 위해 만들어졌습니다.
그래프는 이미 전문가의 머릿속에 존재합니다. 경험 많은 QA 전문가는 관계를 중심으로 사고합니다. 일탈을 조사할 때 의미적으로 유사한 텍스트를 검색하지 않습니다. 그들은 다음과 같은 연결 고리를 추적합니다:
일탈 (Deviation)
→ 관련 장비 (Equipment involved)
→ 해당 장비의 세척 SOP (Cleaning SOP for that equipment)
→ 해당 세척법의 밸리데이션 프로토콜 (Validation protocol for that cleaning method)
→ 밸리데이션 보고서(승인/반려) (Validation report)
→ 해당 공정의 위험 평가 (Risk assessment for that process)
→ 해당 장비의 과거 일탈 이력 (Prior deviations on that equipment)
→ 해당 일탈에서 파생된 CAPA (CAPAs from those deviations)
→ 해당 CAPA가 촉발한 변경 관리 (Change controls triggered by those CAPAs)
→ 해당 공정을 규율하는 규제 인용 (Regulatory citations governing the process)
현재의 RAG 시스템은 벡터 검색과 BM25를 결합한 정교한 하이브리드 RAG라 할지라도 이 사슬을 안정적으로 추적할 수 없습니다. 벡터 임베딩은 문서 ID를 인코딩하지 못합니다. 임베딩 모델의 관점에서 “CAPA-2024-045”와 “CAPA-2024-054”는 의미적으로 동일합니다. 키워드 검색만이 둘을 구분할 수 있습니다. 그리고 평면적인 벡터 데이터베이스는 일탈과 그에 연결된 CAPA, SOP, 장비 적격성평가 사이의 관계에 대한 개념을 전혀 갖고 있지 않습니다.
MasterControl의 AI 팀이 2025년 5월 발표한 결과에 따르면, 트리플렛 기반 지식 그래프(규제 문서에서 주어-서술어-목적어 추출)를 적용했을 때 평균 최단 경로가 1.33홉으로 나타났으며, 이는 인용 네트워크 단독(2.02홉)보다 뛰어난 수치였습니다. 인용을 통해 연결되지 않았던 5,014개의 문서 섹션 중 5,011개가 트리플렛을 통해 연결되었습니다. 품질 문서 간의 의미적 관계는 명시적 인용 참조보다 훨씬 풍부합니다.
OKF의 교차 링크 메커니즘(개념 파일 간의 표준 마크다운 링크)은 이러한 관계를 네이티브 방식으로 포착합니다. 그래프를 탐색하는 에이전트는 실제 인간 조사관이 밟아갈 경로와 동일한 경로를 따라 이동합니다.
GxP 맞춤형 OKF 번들의 형태
순수(vanilla) OKF 사양은 최소한의 규칙만을 요구합니다. 오직 type 필드만 필수입니다. 생명과학 분야에서는 그보다 훨씬 많은 정보가 필요합니다. 사양은 생산자 정의 확장(producer-defined extensions)을 명시적으로 허용하므로, OKF 적합성을 유지하면서 도메인 특화 필드를 추가하는 것이 올바른 접근 방식입니다.
---
type: SOP
title: Environmental Monitoring of Cleanrooms
doc_id: SOP-ENV-042
version: "3.2"
status: Effective
effective_date: 2026-01-15
review_due: 2027-01-15
owner: Microbiology Department
site: [Dublin, CA]
product: [Product A, Product B]
regulatory_framework: [21 CFR Part 211, EU GMP Annex 1]
resource: https://veeva-vault.com/doc/SOP-ENV-042_v3.2
tags: [cleanroom, microbiology, gmp, iso-5]
timestamp: 2026-05-28T14:30:00Z
---
# Purpose
Define procedures for routine environmental monitoring of ISO 5 and ISO 7 cleanrooms.
# Scope
Applicable to all manufacturing areas at the Dublin facility.
# References
- [SOP-QA-001 Deviation Handling](/sops/SOP-QA-001-deviation-handling.md)
- [Environmental Monitoring Log](/forms/env-log.md)
- [21 CFR 211.42](/regulations/21-cfr-211.42.md)
# Related Deviations
- [DEV-2023-889](/deviations/2023/DEV-2023-889.md) — HVAC failure in Suite B
# Action Limits
| Grade | Alert Limit (CFU) | Action Limit (CFU) |
|-------|-------------------|-------------------|
| ISO 5 | 1 | 3 |
| ISO 7 | 10 | 25 |
기본 OKF 사양 대비 추가된 주요 필드는 다음과 같습니다:
doc_id및version— 품질 문서에는 공식 식별자와 버전 번호가 존재합니다. 타임스탬프만으로는 불충분하며, 현재 어떤 개정판이 유효한지(effective) 알아야 합니다.status— Active(활성), Effective(유효), Superseded(대체됨), Draft(초안), Obsolete(폐기). 에이전트는 폐기된 절차를 인용하지 않도록 이 필드를 기반으로 필터링해야 합니다.effective_date및review_due— 규제 필수 요건입니다. 문서는 명확히 정의된 유효 기간을 가집니다.regulatory_framework— 근거 규정(21 CFR Part 211, EU GMP Annex 15, ICH Q10 등)과의 연결 링크입니다.resource— 밸리데이션된 eQMS 내의 서명 및 승인 완료된 공식 PDF를 가리킵니다. 이는 타협할 수 없는 필수 사항입니다.
디렉터리 구조는 단순한 문서 유형뿐 아니라 규제 대상 엔티티를 중심으로 구성됩니다:
quality-system/
├── index.md
├── sops/
│ ├── index.md
│ ├── SOP-ENV-042-cleanroom-monitoring.md
│ └── SOP-QA-001-deviation-handling.md
├── deviations/
│ ├── index.md
│ └── DEV-2023-889-hvac-failure.md
├── capas/
│ ├── index.md
│ └── CAPA-2023-045.md
├── equipment/
│ ├── index.md
│ └── EQ-BR-99-incubator.md
├── validation/
│ ├── index.md
│ └── VP-234-cleaning-validation.md
├── regulations/
│ └── 21-cfr-211.67.md
└── products/
└── product-a/
└── index.md
모든 객체는 독립된 지식 패키지입니다. 에이전트는 관계를 새롭게 발견할 필요가 없으며, 관계는 이미 마크다운 링크로 존재합니다.
규제 마찰점
OKF를 생명과학에 적용할 때, 본래 의도된 데이터 엔지니어링 환경에는 존재하지 않던 5가지 구체적인 반론에 직면하게 됩니다. 이 반론들은 하나하나가 매우 중대합니다.
섀도우 QMS 리스크 (Shadow QMS risk)
21 CFR Part 11과 EU Annex 11이 존재하는 이유는, 생명과학 산업이 동의명령(consent decrees), 제품 리콜, 환자 피해를 겪으면서 통제되지 않은 품질 문서 사본이 얼마나 위험한지 뼈저리게 배웠기 때문입니다. 만약 어떤 SOP가 Veeva Vault에는 서명된 PDF로 존재하고 Git 리포지토리에는 정보가 보강된 마크다운 파일로 존재한다면, 그 마크다운 파일은 명백히 통제되지 않은 사본(uncontrolled copy)입니다. 예외는 없습니다.
“이것은 파생 계층일 뿐이며, 여전히 QMS가 진실의 원천(source of truth)이다”라는 방어 논리는 아키텍처 다이어그램에서는 깔끔하게 들립니다. 하지만 처리 속도가 빠르다는 이유로 마크다운을 읽는 에이전트와 마주하거나, 에이전트가 자신 있게 인용했다는 이유로 OKF 번들에 적힌 세척 시간을 그대로 수행하는 현장 작업자와 맞닥뜨리는 순간 그 논리는 무너집니다. 이중 표현(dual-representation) 시스템은 반드시 괴리(drift)가 발생합니다. OKF 번들은 최신성을 잃을 것입니다. 보강 파이프라인은 대체된 구버전을 놓칠 것입니다. 교차 참조는 엉뚱한 CAPA를 가리키게 될 것입니다. 그리고 그런 일이 실제로 벌어졌을 때, “AI가 실제 SOP가 아니라 섀도우 마크다운 파일을 읽었을 뿐”이라는 식의 법적 방어 논리는 FDA 실사(audit)에서 결코 통하지 않습니다.
밸리데이션 부담 (Validation burden)
GAMP 5 및 ISPE GAMP AI 가이드(2025년 7월 발행, 290페이지)에 따르면, GxP 데이터에 관여하는 모든 시스템은 밸리데이션 대상이 될 수 있습니다. Veeva에서 문서를 추출하고, 마크다운으로 변환하며, LLM으로 보강하고, Git 리포지토리에 저장하는 파이프라인은 엄연한 GxP 소프트웨어입니다. 이 파이프라인에는 설치 적격성평가(IQ), 운전 적격성평가(OQ), 성능 적격성평가(PQ), 모든 수정에 대한 변경 관리, 정기적 검토, 그리고 모델 변경, 프롬프트 수정, OKF 사양 판올림, 추출 로직 변경 시의 재밸리데이션이 필수적으로 요구됩니다.
보강 에이전트의 프롬프트를 한 번 수정할 때마다 밸리데이션 완료 시스템에 대한 공식 변경 절차를 거쳐야 합니다. 모델 업그레이드 시마다 재밸리데이션을 수행해야 합니다. 이 파이프라인을 구축하고 밸리데이션을 완료할 때쯤이면, 규제 기관이 인정할 수 있는 확실한 책임을 지고 업무를 수행할 품질 전문가 세 명을 채용하는 것보다 더 많은 비용을 쓰게 됩니다.
ISPE AI 가이드는 이를 매우 구체적으로 다룹니다. 학습 데이터 출처(provenance), 모델 문서화, 정의된 테스트 조건 하에서의 성능 입증 자료, 변경 통지 약정, 설명 가능성(explainability) 산출물을 요구합니다. LLM을 기반으로 자체 제작한 맞춤형 OKF 생성기의 경우, “다른 AI가 읽기 쉽게 만든다”는 가치 제안 하나를 위해 막대한 규모의 밸리데이션 패키지를 감당해야 하는 셈입니다.
벤더 API 솔루션의 기확보
2025년 초, Veeva는 Vault 플랫폼에 추가 라이선스 비용 없이 기본 포함되는 Direct Data API를 발표했습니다. 이 API는 대규모 데이터셋 전반에 걸쳐 트랜잭션 일관성을 유지하면서 기존 API 대비 최대 100배 빠른 속도로 Vault 데이터를 제공합니다. 또한 15분 주기로 전체, 증분, 로그 데이터 파일을 생성합니다. Snowflake, Databricks, Redshift, Azure SQL, SQLite용 오픈소스 액셀러레이터도 GitHub에 공개되어 있습니다.
생명과학 분야의 에이전틱 AI를 정조준한 Veeva와 Snowflake의 파트너십은 업계가 나아가는 방향을 분명히 보여줍니다. 그것은 바로 ’밸리데이션된 QMS → 고처리량 API → 데이터 웨어하우스 → AI 에이전트’의 흐름입니다. ’밸리데이션된 QMS → 마크다운 내보내기 → Git 리포지토리 → 파일을 읽는 에이전트’가 아닙니다.
OKF가 해결하고자 했던 파편화 문제는 이미 인프라 계층에서 벤더들에 의해 직접 해결되고 있습니다. Snowflake에 접근 권한을 가진 에이전트는 수학적으로 정확한 관계를 반환하는 SQL 조인(JOIN)으로 실시간 QMS 데이터 모델을 쿼리할 수 있습니다. 엉뚱한 파일을 가리킬 위험이 있는 마크다운 링크에 의존할 이유가 없습니다.
지식 그래프 유지 관리 비용
2025년 엔터프라이즈 데이터 리더 대상 설문조사에 따르면, 중단된 지식 그래프 프로젝트의 67%가 “사내 그래프 전문 지식 부족”을 주된 실패 원인으로 꼽았습니다. 팀들은 대체로 18개월 이내에 도입을 포기하거나, 더 단순한 대안들을 훨씬 초과하는 비용을 지출하며 운영을 이어갑니다. 지식 그래프는 데이터 품질 문제를 해결하기보다는 오히려 증폭시키는 경향이 있습니다. 엔티티 식별/연계(entity resolution) 정확도가 85% 미만으로 떨어지면, 그래프는 엉뚱한 문서들을 확신을 갖고 연결해 버려 후속되는 모든 인사이트를 신뢰할 수 없게 만듭니다.
생명과학 분야에서는 이 문제가 더욱 심각합니다. 단 하나의 SOP 변경만으로도 밸리데이션 프로토콜, 교육 매트릭스, 장비 적격성평가, 규제 인용, CAPA 연계 전반에 걸쳐 연쇄적인 관계 업데이트가 촉발됩니다. 이러한 링크들이 자동으로 유지되지 않으면 금세 쓸모없는 구식 정보가 됩니다. 반대로 LLM을 통해 자동으로 유지 관리하도록 만든다면, 그 자체로 밸리데이션이 필요한 복잡한 시스템을 구축하게 되는 셈이며, 그 와중에 LLM은 제목이 비슷하다는 이유만으로 DEV-2024-1142를 엉뚱한 CAPA에 확신을 갖고 잘못 연결해 버릴 것입니다.
마크다운의 과도한 자유도 vs. 강제된 구조
“파일을 cat할 수 있다면 OKF를 읽을 수 있다”는 OKF의 홍보 문구는 개발자에게 매력적입니다. 그러나 품질 전문가는 변경 추적이 적용된 Word 문서, 통제된 헤더가 있는 PDF, 전자 서명 워크플로우를 기반으로 사고합니다.
마크다운은 규제 대상 문서에 쓰이기에는 지나치게 자유롭습니다(permissive). SOP는 반드시 목적(Purpose), 적용 범위(Scope), 책임(Responsibilities), 정의(Definitions), 절차(Procedure), 참조(References), 개정 이력(Revision History)을 매번 동일한 순서로 갖추어야 합니다. 마크다운을 사용하면 작성자마다 헤더 서식이 달라지고, 일부 섹션을 누락하며, CAPA 보고서에서 섹션 헤더가 어떤 파일에서는 # Root Cause Analysis이고 다른 파일에서는 ## Determination of Causal Factors로 되어 있어 에이전트가 “근본 원인”을 안정적으로 추출하는 데 실패합니다. 또한 “사람이 읽기 쉽다”는 장점도 무의미합니다. 품질 문서는 이미 밸리데이션된 eQMS 내부에서 현재 포맷 그대로 사람이 충분히 읽을 수 있습니다. GitHub에서 렌더링하기 편해지는 대신 품질 시스템의 핵심인 강제된 구조(enforced structure)를 잃어버리게 됩니다.
모든 측면이 수렴한 지점
이러한 반론들은 타당합니다. 그러나 기본 통찰 자체를 무너뜨리지는 못합니다. 기존의 친(親) OKF 논리를 규제 현실, 밸리데이션 경제성, 그리고 QMS 벤더들이 실제로 구축 중인 기술과 대조하여 엄격하게 검증했을 때 도출된 솔직한 결론은 다음과 같습니다. OKF는 문제의 쉬운 부분만 해결할 뿐 정작 어려운 핵심은 전혀 건드리지 못하며, 최종 승자가 될 아키텍처는 마크다운 파일 디렉터리와는 완전히 다른 모습입니다.
10개의 독립적인 분석에 “생명과학 품질 조직이 OKF를 도입해야 하는가?“라는 동일한 질문을 던졌을 때, 모든 분석이 예외 없이 동일한 아키텍처로 수렴했습니다:
| 계층 (Layer) | 역할 (Role) | OKF 관여도 (OKF involvement) |
|---|---|---|
| 밸리데이션된 QMS (Veeva, MasterControl) | 진실의 원천 (Source of truth) | 없음 |
| 데이터 웨어하우스 / 시맨틱 인덱스 | 구조화된 컨텍스트 계층 | 없음 |
| 동적 지식 그래프 | 관계 탐색 (Relationship traversal) | QMS 메타데이터로부터 동적 구축 |
| 에이전트 도구 (Agent tools) | 실시간 API 대상 함수 호출 (Function calling) | OKF 형태의 응답, 일회성(ephemeral) 제공 |
| 인간의 결정 (Human decision) | 승인 및 감독 | 없음 |
10개 분석 중 eQMS의 대체재로 OKF를 도입하자고 권고한 곳은 단 한 곳도 없었습니다. 구조화된 지식 표현을 완전히 포기하고 PDF에 대한 단순 RAG만 사용하자고 권고한 곳 역시 단 한 곳도 없었습니다.
모든 분석에서 일관되게 확인된 세 가지 공통점은 다음과 같습니다:
-
기본 통찰은 옳습니다. 생명과학 분야의 AI 에이전트는 분할된(chunked) PDF에 대한 단순 벡터 유사도 검색이 아니라, 관계가 명시적으로 연결된 구조화된 지식을 필요로 합니다. 품질 조사에서는 시맨틱 검색보다 그래프 탐색이 훨씬 우월합니다. 교차 참조와 추적성(traceability)이 핵심입니다.
-
밸리데이션된 시스템이 반드시 진실의 원천으로 유지되어야 합니다. 21 CFR Part 11, EU Annex 11, 그리고 ALCOA+ 데이터 완전성 원칙은 절대 타협할 수 없습니다. 전자 서명, 불변의 감사 추적(audit trail), 접근 제어, 변경 관리는 eQMS 내부에서 이루어져야 합니다. Git 리포지토리의 마크다운 파일은 통제된 문서가 아닙니다.
-
파생된 지식 계층(derived knowledge layer)이 올바른 패턴입니다. 밸리데이션된 시스템과 AI 에이전트 사이에는 고립된 사일로 전반의 컨텍스트를 조합하고, 관계를 보존하며, 지식을 에이전트가 소비할 수 있도록 만드는 프로젝션(projection) 계층이 반드시 존재해야 합니다.
실제 이견이 있었던 부분은 두 가지 구현 방식에 관한 것이었습니다. 파생 계층은 영속적(persistent)이어야 할까요, 아니면 일회성(ephemeral)이어야 할까요? 정답은 영속적인 인덱스, 일회성 콘텐츠입니다. 메타데이터와 관계는 느리게 변하고 QMS 스키마에서 결정론적으로 도출되므로 영속적인 그래프로 유지할 수 있습니다. 반면 문서 콘텐츠는 자주 변경되고 정보의 노후화가 컴플라이언스 위험을 초래하므로 실시간으로 호출하거나 빈번하게 갱신해야 합니다.
포맷은 마크다운이어야 할까요, 구조화된 데이터여야 할까요? 정답은 선택적 렌더링 레이어로서 마크다운을 지원하는 구조화된 데이터입니다. Veeva Direct Data API는 완전한 스키마 메타데이터를 포함한 구조화된 CSV를 내보냅니다. MCP는 구조화된 JSON 응답을 제공합니다. 에이전트에게 필요한 것은 마크다운이 아니라 명시적 관계를 지닌 구조화된 데이터입니다. 사람이 읽을 수 있는 렌더링이 필요한 경우 기본 저장 형식이 아니라 구조화된 데이터로부터 즉시 동적으로 생성할 수 있습니다.
최종 아키텍처
모든 분석이 수렴하고 업계가 실제로 구축하고 있는 아키텍처는 다음과 같습니다:
밸리데이션된 QMS (Veeva Vault)
↓ Direct Data API / MCP 커넥터 (읽기 전용, 15분 주기 갱신)
데이터 통합 계층 (Snowflake / 시맨틱 인덱스)
↓ QMS 메타데이터 기반 동적 지식 그래프
↓ 문서 콘텐츠 기반 벡터 임베딩
AI 에이전트 계층 (MCP 도구 사용, 함수 호출)
↓ 검색 과정 전체 감사 추적 (Full retrieval audit trail)
인간의 최종 결정 (원천 문서 인용 포함)
마크다운 파일은 없습니다. Git 리포지토리도 없습니다. 별도의 병렬 문서 포맷도 없습니다. 지식 표현은 데이터 웨어하우스와 MCP 도구 정의 내에 상주합니다. 그래프는 QMS 메타데이터로부터 동적으로 생성됩니다. 에이전트는 시간에 민감한 데이터를 얻기 위해 실시간 API를 호출합니다.
왜 PostgreSQL인가 — 그리고 왜 지금 중요한가
QMS를 백지상태에서 새롭게 구축하는 조직의 경우, 모든 분석이 구체적으로 PostgreSQL을 지목했습니다. 그 이유는 두 가지입니다:
첫째: 유연한 메타데이터 처리를 위한 JSONB 컬럼입니다. 품질 문서에는 엄격하게 규정된 필수 필드(문서 ID, 버전, 상태, 효력 발생일)가 있는 동시에 유형에 따라 가변적인 메타데이터가 존재합니다. 일탈(deviation)에는 심각도, 근본 원인 분류, 영향받은 배치가 필요합니다. 밸리데이션 프로토콜에는 적격성 판정 기준, 통계적 분석 방법, 샘플 크기가 요구됩니다. PostgreSQL의 JSONB를 활용하면 관계형 컬럼에서 필수 필드를 강제하는 동시에 JSON Schema 제약 조건이 적용된 밸리데이션 완료 JSONB 필드에 유형별 메타데이터를 유연하게 저장할 수 있습니다.
둘째: PostgreSQL 19의 네이티브 그래프 쿼리 지원입니다. 이는 아키텍처 설계의 판도를 바꾸어 놓은 기술적 진전입니다. 2026년 6월 베타 버전이 공개된 PostgreSQL 19는 ISO SQL:2023 표준인 SQL/PGQ(Property Graph Queries)를 공식 구현했습니다. 기존 관계형 테이블 상에 속성 그래프(property graph)를 뷰 형태로 정의한 후, MATCH 구문을 사용하여 직관적으로 쿼리할 수 있습니다:
SELECT * FROM GRAPH_TABLE (quality_graph
MATCH (dev IS deviation WHERE dev.id = 'DEV-2026-102')
-[IS involved_equipment]->(eq IS equipment)
-[IS governed_by]->(sop IS sop)
-[IS validated_by]->(vp IS validation_protocol)
COLUMNS (eq.name, sop.doc_id, vp.doc_id, vp.status)
);
이 쿼리는 단 한 번의 실행으로 일탈 → 장비 → SOP → 밸리데이션 프로토콜을 순회합니다. 별도의 그래프 데이터베이스가 필요하지 않습니다. Neo4j도, Apache AGE 확장도, 데이터 마이그레이션도 필요 없습니다. 그래프는 밸리데이션된 데이터를 저장하고 있는 바로 그 테이블 상에서 동일한 인덱스를 활용하여 동작합니다.
“이 일탈과 3홉 이내로 연결된 모든 항목을 보여달라”는 지식 그래프 기능이 핵심인 QMS의 경우, 이는 신규 시스템에 그래프 기능을 구축할 때 직면하던 가장 큰 아키텍처적 장벽을 완전히 해소해 줍니다.
OKF 형태의 API 계약
데이터베이스는 밸리데이션된 상태를 유지합니다. 지식 그래프는 관계를 포착합니다. API는 에이전트의 요청에 따라 온디맨드 방식으로 재생성되는 일회성 OKF 형태의 프로젝션을 제공합니다.
모든 품질 객체는 OKF 형태의 응답을 반환하는 엔드포인트를 노출합니다:
GET /api/v1/okf/concepts/sop/SOP-00123
반환 결과:
---
type: SOP
doc_id: SOP-00123
title: Equipment Cleaning - Grade C/D Areas
version: 4.2
status: Effective
effective_date: 2026-01-15
review_due: 2027-01-15
owner: Manufacturing QA
site: [Dublin, CA]
product: [Product A, Product B]
regulation_refs: [21 CFR 211.67, EU GMP Annex 1]
resource: /api/v1/qms/documents/SOP-00123/v4.2/pdf
staleness: 2026-07-11T04:00:00Z
training_required: true
risk_level: High
---
# Purpose
Standard cleaning procedure for equipment in Grade C and D areas
at the Dublin facility.
# Related Documents
- [Work Instruction WI-088](/api/v1/okf/concepts/work-instruction/WI-088)
- [Validation Protocol VP-234](/api/v1/okf/concepts/validation/VP-234)
- [Equipment EQ-442](/api/v1/okf/concepts/equipment/EQ-442)
- [21 CFR 211.67](/api/v1/okf/concepts/regulation/21-cfr-211.67)
# AI Guidance
retrieval_priority: high
common_questions:
- "What cleaning method is required after Product X?"
- "What is the rinse verification procedure?"
known_risks:
- "Cleaning validation failures when operators skip rinse verification (Section 3.2.4)"
여기서 주목해야 할 세 가지 포인트가 있습니다:
resource 필드는 실시간 QMS를 가리킵니다. 에이전트가 인용, 검증, 승인 문서가 요구되는 의사결정을 위해 실제 통제된 PDF를 필요로 하는 경우, 리소스 링크를 따라 교육 요건과 접근 제어가 강제되는 밸리데이션 완료 시스템으로 직접 접근합니다.
staleness 필드는 타임스탬프이며 보증이 아닙니다. 에이전트는 승인 상태, 효력 발생 버전 등 시간에 민감한 필드를 참조하기 전에 이 타임스탬프를 확인해야 합니다. 의사결정에 직결되는 사항의 경우, 에이전트는 실시간 시스템을 대상으로 GET /api/v1/qms/status/SOP-00123을 직접 호출합니다.
AI Guidance 섹션은 규제 콘텐츠와 명확히 분리됩니다. 자주 묻는 질문, 알려진 위험, 검색 우선순위 등은 에이전트의 효과적인 추론을 돕는 AI 전용 보강 필드입니다. 이 필드들은 규제 콘텐츠와 분리되어 저장되므로 문서 자체에 대한 변경 관리를 촉발하지 않고도 업데이트할 수 있습니다.
그래프 계층
그래프는 기존 관계형 테이블 상에 속성 그래프로 정의됩니다:
CREATE PROPERTY GRAPH quality_graph
VERTEX TABLES (
sops LABEL sop
PROPERTIES (id, doc_id, title, version, status, effective_date),
deviations LABEL deviation
PROPERTIES (id, deviation_id, severity, status, discovered_date),
capas LABEL capa
PROPERTIES (id, capa_id, status, effectiveness_status),
equipment LABEL equipment
PROPERTIES (id, equipment_id, name, location, qualification_status),
validation_protocols LABEL validation
PROPERTIES (id, doc_id, title, status),
regulations LABEL regulation
PROPERTIES (id, regulation_id, title, framework)
)
EDGE TABLES (
sop_references_equipment
SOURCE KEY (sop_id) REFERENCES sops (id)
DESTINATION KEY (equipment_id) REFERENCES equipment (id)
LABEL references,
deviation_involves_equipment
SOURCE KEY (deviation_id) REFERENCES deviations (id)
DESTINATION KEY (equipment_id) REFERENCES equipment (id)
LABEL involves,
capa_closes_deviation
SOURCE KEY (capa_id) REFERENCES capas (id)
DESTINATION KEY (deviation_id) REFERENCES deviations (id)
LABEL closes,
sop_validated_by
SOURCE KEY (sop_id) REFERENCES sops (id)
DESTINATION KEY (protocol_id) REFERENCES validation_protocols (id)
LABEL validated_by
);
그래프의 엣지(Edge)는 데이터베이스의 외래 키에서 직접 파생됩니다. 이는 QMS가 이미 강제하고 있는 관계와 동일합니다. 수작업으로 관리하는 마크다운 링크도 없고, LLM이 보강한 부정확한 교차 참조도 없습니다. 그래프는 데이터베이스만큼 정확합니다. 그래프가 곧 그래프 형태로 바라본 데이터베이스 그 자체이기 때문입니다.
에이전트가 관계를 탐색해야 할 때는 다음 엔드포인트를 호출합니다:
GET /api/v1/okf/graph/deviation/DEV-2026-102?hops=3
API는 SQL/PGQ MATCH 쿼리를 실행하고, 연결된 서브그래프를 마크다운 링크로 표현된 관계와 함께 일련의 OKF 개념 세트로 반환합니다. 에이전트는 데이터베이스에 직접 접근하지 않고도 자유롭게 탐색 가능한 지식 그래프를 확보하게 됩니다.
밸리데이션 전략
바로 이 지점에서 본 아키텍처는 규제 환경에 안착할 수 있는 정당성을 확보합니다.
밸리데이션 대상:
- PostgreSQL 데이터베이스 스키마 및 제약 조건
- API 엔드포인트 및 권한 강제 로직
- PDF 렌더링 엔진 (서명 시점의 데이터베이스 → 표준 PDF 생성)
- OKF 직렬화(serialization) 로직 (데이터베이스 → OKF 형태 응답)
밸리데이션 비대상:
- OKF 콘텐츠 자체 (매 요청마다 재생성되는 파생 프로젝션임)
- OKF 응답을 소비하는 에이전트 (밸리데이션된 API로부터 데이터를 읽음)
- AI 보강 필드 (규제 콘텐츠가 아닌 자문 목적의 참고 정보임)
이는 맞춤형 마크다운 내보내기 파이프라인 전체를 밸리데이션하는 것보다 훨씬 비용 효율적입니다. OKF 직렬화는 결정론적 함수(동일한 DB 상태 → 동일한 OKF 출력)입니다. 단 한 번 검증하고 신뢰할 수 있습니다. 데이터베이스는 이미 QMS 자체이므로 기본적으로 밸리데이션이 완료되어 있습니다.
에이전트 워크플로우 예시
이 아키텍처 내에서 일탈 조사 에이전트가 동작하는 과정은 다음과 같습니다:
- 사용자로부터 일탈 설명 내용을 수신합니다.
GET /api/v1/okf/concepts/deviation/DEV-2026-102를 호출하여 구조화된 메타데이터 및 관련 링크를 가져옵니다.GET /api/v1/okf/graph/deviation/DEV-2026-102?hops=3을 호출하여 연결된 서브그래프(장비, SOP, 과거 일탈, CAPA, 밸리데이션 기록)를 확보합니다.- 연결된 각 엔티티의 OKF 개념을 확인하여 AI 가이드가 포함된 구조화된 컨텍스트를 파악합니다.
GET /api/v1/qms/documents/SOP-00123/v4.2/sections/3.2를 호출하여 실시간 QMS로부터 구체적인 절차 섹션을 가져옵니다(이 과정에서 사용자 교육 이수 여부 체크가 강제됩니다).- 완벽한 추적성을 갖춘 조사 출발점 초안을 종합 정리합니다.
- 모든 출처를 명시하여 검토자에게 초안을 제시합니다.
모든 단계가 로깅됩니다. 모든 문서 접근은 감사 추적이 가능합니다. 에이전트는 결코 QMS에 직접 쓰기 작업을 하지 않습니다. 모든 최종 결정은 인간이 승인합니다.
기존 시스템을 위한 실무 롤아웃 플레이북
이 글을 읽는 대부분의 조직은 QMS를 백지상태에서 새로 만들지 않습니다. 이미 Veeva, MasterControl, TrackWise, 혹은 2014년부터 밸리데이션을 거쳐 사용 중인 자체 QMS를 보유하고 있습니다. 이를 통째로 걷어낼 수도 없고, 전면 재밸리데이션을 진행할 수도 없습니다. 월요일 아침 출근 즉시 실제로 무엇을 해야 할지 알아야 합니다.
대원칙은 명확합니다: 밸리데이션된 시스템을 AI 친화적으로 개조하려 하지 마십시오. AI가 밸리데이션된 시스템을 이해하도록 만드십시오.
3대 컴플라이언스 영역 (The Three Zones)
도입 패턴을 선택하기 전에 컴플라이언스 환경을 정확히 이해해야 합니다. 규제 대상 조직의 모든 지식은 다음 세 가지 영역 중 하나에 속합니다:
그린 존 (Green Zone, 비GxP): 현장 암묵지(Tribal knowledge), 엔지니어링 메모, 규제 지침 해석, 내부 런북, 회의록, 프로젝트 문서. 21 CFR Part 11 요건이 적용되지 않습니다. 밸리데이션 부담이 없습니다. OKF를 가장 적극적으로 활용할 수 있습니다.
옐로우 존 (Yellow Zone, GxP 인접): 승인된 SOP, 밸리데이션 프로토콜, 일탈 기록, CAPA 기록. 이들은 밸리데이션된 시스템 내에 존재합니다. OKF는 읽기 전용 파생 계층으로만 활용될 수 있으며, 결코 진실의 원천이 되어서는 안 됩니다.
레드 존 (Red Zone, GxP 통제): 전자 서명, 감사 추적, 승인 워크플로우, 배치 출하 승인 결정. OKF가 관여할 수 없는 영역입니다. 이들은 밸리데이션된 시스템 내에 손대지 않은 채 그대로 유지되어야 합니다.
롤아웃 전략: 그린 존에서 시작하여 가치를 입증하고, 엄격한 통제를 적용하며 옐로우 존으로 확장하되, 레드 존은 절대 건드리지 마십시오.
10가지 도입 패턴
10개의 독립적 분석을 종합하여 도출한 실무 롤아웃 패턴은 다음과 같습니다:
1. 현장 암묵지 캡처 (그린 존). 모든 규제 조직에는 어떤 밸리데이션 시스템에도 기록되지 않은 방대한 지식이 존재합니다. 특정 공정이 왜 그렇게 설계되었는지, 지난 세 번 동안 공급업체가 제조소를 변경했을 때 어떤 일이 있었는지, 모호한 분석 결과를 해석하는 불문율 등이 이에 해당합니다. 장비, 공정, 규제 해석별로 정리된 OKF 구조의 지식 베이스를 구축하십시오. 규제 위험은 전혀 없으며, 밸리데이션 부담도 없습니다. 신규 입사자 온보딩 및 에이전트 컨텍스트 제공에 즉각적인 가치를 발휘합니다.
2. 규제 인텔리전스 위키 (그린 존). FDA 가이던스, ISO 표준, ICH 지침, EU Annex 등은 대부분 정적이고 공개된 자료이므로 OKF 구조로 표현하기에 완벽한 대상입니다. AI에게 400페이지짜리 가이던스 문서를 매번 파싱하게 하는 대신, 사내 SOP 및 실무 해석과의 교차 참조가 포함된 구조화된 규제 지식을 제공하십시오.
3. 도메인 온톨로지 구축 (그린 존). OKF 포맷으로 전사 품질 사전을 구축하십시오. 장비, 제품, 배치, 일탈, CAPA, 밸리데이션, SOP, 공급업체, 위험 등 모든 규제 대상 엔티티는 정의, 관계, 동의어, 자주 묻는 질문, 규제 참조를 포함한 자체 개념 파일을 갖습니다. 이는 “우리 회사에서 이 용어가 정확히 무엇을 의미하는가?“라는 엔터프라이즈 AI의 가장 고질적인 문제를 해결합니다.
4. 야간 사이드카 내보내기 (옐로우 존 — 가장 큰 성과). 밸리데이션 경계 외부에서 실행되는 경량 서비스를 구축하십시오. 매일 밤 밸리데이션된 API를 호출하여 ‘Effective(유효)’ 상태의 문서만을 추출하고, 별도의 비GxP 버킷에 OKF 번들로 렌더링합니다. 우선 내보낼 대상: 일탈 및 CAPA 지식 그래프(가장 고통스럽고 위험은 가장 낮음), SOP 및 규격 인덱스(전체 절차가 아닌 목적, 범위, 주요 파라미터, 장비 목록 중심), 변경 관리 추적 내역. 생성된 모든 개념에는 필수적인 출처 메타데이터가 포함됩니다:
---
type: Deviation
doc_id: DEV-2026-102
source_system: veeva_vault
source_id: DOC-2024-00847
source_url: https://vault.company.com/DOC-2024-00847
source_last_modified: 2026-07-10T14:30:00Z
bundle_generated_at: 2026-07-11T02:00:00Z
---
익스포터 운영 원칙: Effective 및 Closed 상태로만 필터링(초안 제외), v1에서는 보강하지 않고 단순 렌더링만 수행(LLM 재작성 금지 — QMS 필드에서 프론트매터로의 결정론적 매핑), 렌더링 시점에 접근 권한 필터링 적용(에이전트 사용자가 SOP-123에 대한 교육을 이수하지 않았다면 번들에 미포함), 모든 데이터에 NON GXP - DECISION SUPPORT - VERIFY IN SYSTEM OF RECORD 라벨 명시.
5. 시스템 간 교차 연계 (옐로우 존). 가장 가치 있는 적용처는 개별 시스템의 대체가 아니라 서로 대화하지 않는 시스템들에 지식이 흩어져 있는 지점입니다. eQMS의 SOP, LIMS의 시험법 밸리데이션, 별도 툴의 일탈 이력, CMMS의 장비 로그 등이 해당합니다. 일관된 type 규칙을 적용하여 각 시스템에서 OKF 개념을 생성하고, 마크다운 링크를 연결 고리로 활용하십시오. 이를 통해 기본 시스템들이 직접 통합되지 않더라도 에이전트가 탐색하고 질의할 수 있는 통합 그래프를 얻을 수 있습니다. 이것이 바로 엔터프라이즈 AI 전반에서 부상하고 있는 “AI 사이드카(AI Sidecar)” 패턴입니다. 핵심 시스템을 건드리지 않고 기존 애플리케이션과 나란히 실행되며 데이터를 가로채고 인텔리전스를 적용하여 보강된 결과를 반환하는 분리된 지능 계층입니다.
6. 조사 플레이북 (그린/옐로우 존). 일탈 조사는 절차적입니다. 배치 이력 확인, 장비 로그 확인, 환경 모니터링 검토, 교육 이력 검토, 세척 기록 검토, 유지보수 기록 검토, 과거 CAPA 검토 등을 순차적으로 거칩니다. AI가 읽을 수 있는 조사 가이드를 OKF 포맷으로 작성하십시오. 에이전트는 과거 보고서에 대한 단순 벡터 유사도 검색에 의존할 때보다 구조화된 절차 지식을 따를 때 훨씬 더 뛰어난 조사관이 됩니다.
7. AI 컴패니언 객체 (옐로우 존). 모든 통제된 문서는 비통제 컴패니언(companion) 객체를 가집니다. SOP 원본은 Veeva에 유지됩니다. 그 옆에 요약, 자주 묻는 질문, 관련 장비, 전형적인 일탈, 주요 위험을 담은 AI 컴패니언이 공존합니다. 컴패니언은 SOP가 변경될 때마다 자동으로 재생성됩니다. 에이전트는 컴패니언을 먼저 읽고 필요한 경우에만 근거 확보를 위해 원본 문서를 깊이 탐색합니다. 이를 통해 접지(grounding) 정확도를 높이면서 토큰 사용량을 대폭 절감할 수 있습니다.
8. 실사 대비 번들 (옐로우 존). FDA 실사 전에 검사관에게 안내할 OKF 번들을 생성하십시오. 제품 규격, 제조 공정 흐름, 밸리데이션 프로토콜, 배치 기록, 일탈 및 CAPA를 원천 시스템의 통제된 기록으로 연결되는 링크와 함께 제공합니다. 이는 데이터 마이그레이션이 아닌 가이드 투어입니다. 현재 검사관들은 5개 시스템에서 기록을 직접 찾아 관계를 수작업으로 설명해 줄 것을 요구합니다. OKF 번들은 원본 기록을 밸리데이션된 위치에 온전히 유지하면서 읽기 쉽고 탐색 가능한 내러티브를 제공합니다.
9. MCP 도구 연동. Anthropic이 개발하고 OpenAI, Google, Microsoft, AWS가 채택한 Model Context Protocol(MCP)을 사용하면 AI 에이전트가 완전한 감사 추적과 접근 제어를 유지하며 실시간 API를 대상으로 도구를 호출할 수 있습니다(get_effective_version("SOP-00123"), list_open_capas("Product-A"), search_deviations("Equipment-442", last_n_months=24)). USDM은 MCP를 규제 대상 AI 통합 계층으로 규정하고 있으며, Deepsense.ai는 헬스케어 및 생명과학을 위한 프로덕션 MCP 서버를 구축하고 있습니다. 이것이 바로 아키텍처를 실질적으로 작동하게 만드는 프로토콜 계층입니다.
10. 지속적 재생성 파이프라인. 파생 계층은 결코 정적 스냅샷이 아닙니다. 정해진 주기(콘텐츠는 야간, 상태는 실시간)에 따라 밸리데이션된 원천 데이터로부터 지속적으로 재구축되는 프로젝션입니다. 번들 생성 타임스탬프는 모든 개념의 프론트매터에 기록됩니다. 에이전트나 실사관은 번들의 최신 여부를 기계적으로 검증할 수 있습니다.
단계별 롤아웃 일정
| 주차 / 개월 | 패턴 | 위험도 | 기대 가치 |
|---|---|---|---|
| 1~2주차 | 현장 암묵지 캡처 (Tribal Knowledge Capture) | 없음 | 높음 |
| 3~4주차 | 규제 인텔리전스 위키 (Regulatory Intelligence Wiki) | 없음 | 중간 |
| 2개월차 | 야간 사이드카 내보내기 (일탈/CAPA) | 낮음 | 매우 높음 |
| 3개월차 | 시스템 간 교차 연계 (2개 시스템) | 낮음 | 높음 |
| 4개월차 | AI 컴패니언 객체 (상위 50개 SOP) | 낮음 | 높음 |
| 6개월차 | 실사 대비 번들 (Audit Preparation Bundles) | 낮음 | 높음 |
| 9개월차 | 조사 플레이북 (Investigation Playbooks) | 낮음 | 중간 |
안티 패턴 (주의해야 할 사항)
절대로 하지 말아야 할 행동들:
- 승인된 SOP를 통제 기록으로서 OKF 마크다운 파일 형태로 보관하지 마십시오.
- 에이전트가 OKF 파일을 편집하고 이를 QMS로 역동기화하도록 허용하지 마십시오.
- OKF를 배치 기록의 기본 데이터베이스로 사용하지 마십시오.
- 스타트업에서 OKF를 경량 eQMS 대용으로 취급하지 마십시오.
- 보강 LLM이 절차 텍스트를 임의로 재작성하게 두지 마십시오. 오직 렌더링만 수행해야 합니다.
- Git 커밋 이력을 규제 감사 추적과 혼동하지 마십시오. 감사 추적은 원천 시스템 내에 유지되어야 합니다.
OKF가 남긴 진정한 기여
비록 포맷 자체가 규제 환경의 최종 해답은 아닐지라도, OKF가 이번 논의에 남긴 기여는 분명합니다. OKF에서 제시된 세 가지 핵심 개념은 현재 업계가 구축 중인 아키텍처에 깊이 스며들어 있습니다:
파일당(또는 레코드당) 하나의 개념. 거대한 단일 문서 속에 파묻히지 않고 독립적이며 스스로를 설명하는 엔티티를 중심으로 지식을 조직해야 한다는 원칙은 QMS 데이터 모델의 작동 방식과 정확히 일치합니다. 일탈도 하나의 레코드이고, CAPA도 하나의 레코드이며, SOP 버전도 하나의 레코드입니다. 각 레코드는 구조화된 메타데이터를 가지며 다른 레코드와 연결됩니다.
구조화된 메타데이터로서의 YAML 프론트매터. 모든 지식 단위가 쿼리 가능한 메타데이터(유형, 상태, 버전, 효력 발생일, 태그 등)를 수반해야 한다는 개념은 이제 모든 QMS 데이터 모델의 표준이 되었습니다. Veeva의 Direct Data API 역시 콘텐츠와 함께 정확히 이러한 구조화된 메타데이터를 내보냅니다.
그래프로서의 교차 링크. 개념 간의 관계가 암시적이 아닌 명시적이어야 한다는 원칙은 생명과학 분야 모든 지식 그래프 구현의 기초가 되었습니다. 유일한 차이점은 업계가 이 그래프를 마크다운 링크가 아닌 QMS 데이터베이스 관계를 바탕으로 구축한다는 점입니다.
OKF는 이러한 아이디어를 하나의 공식 사양으로 정립했습니다. 업계는 이를 API, 데이터 웨어하우스, 에이전트 프로토콜을 통해 구현하고 있습니다. 사양 자체는 훌륭한 사고의 도구였습니다. 다만 실제 구현 경로는 다른 인프라를 통해 진행되고 있습니다.
핵심 요약
명시적 지식, 연결된 개념, 구조화된 메타데이터, 그래프 탐색이라는 OKF 배후의 패턴은 규제 환경의 AI에 정확히 들어맞는 올바른 패턴입니다. 포맷은 이를 명확히 표현하기 위한 유용한 도구였습니다.
그러나 업계가 필요로 하는 구현체는 이미 개발되고 있으며, 마크다운 파일 디렉터리가 아니라 API, 데이터 웨어하우스, 에이전트 프로토콜을 통해 실현되고 있습니다.
기존 밸리데이션 완료 시스템을 보유한 조직이라면: 마크다운 지식 베이스를 별도로 구축하지 마십시오. 밸리데이션 부담과 데이터 괴리 위험이 실재하며, 벤더들이 병렬 문서 포맷을 유지할 필요가 없는 계층에서 문제를 해결하고 있습니다. 단순히 PDF를 벡터 데이터베이스에 밀어 넣는 방식도 지양하십시오. 문서 청크에 의존하는 순수 RAG는 관계를 유실하고 버전 관리를 놓치며 문서 ID를 식별하지 못합니다. 밸리데이션된 시스템과의 커넥터에 투자하십시오. Veeva Direct Data API는 무료이며 빠르고, MCP는 광범위한 벤더 지원을 받는 개방형 프로토콜입니다. QMS 메타데이터 기반의 동적 지식 그래프를 구축하십시오. 에이전트가 시간에 민감한 데이터를 다룰 때 실시간 API를 강제 호출하도록 만드십시오. 컴플라이언스를 위해 모든 검색 과정을 로깅하십시오.
새롭게 시스템을 구축하는 조직이라면: 데이터베이스가 진실이고, 그래프는 관계이며, OKF는 에이전트 대면 계약입니다. 에이전트에게 OKF로 소통하는 밸리데이션 코어, 에이전트가 탐색할 수 있는 지식 그래프, 모든 엔드포인트에서 컴플라이언스를 강제하는 API를 구축하십시오. SQL/PGQ를 지원하는 PostgreSQL 19를 사용하면 불과 1년 전보다 훨씬 단순하게 이 아키텍처를 구현할 수 있습니다.
차세대 QMS 스타트업은 “밸리데이션되었지만 불투명한 시스템”과 “AI 친화적이지만 통제되지 않는 시스템” 사이에서 양자택일하지 않을 것입니다. 처음부터 두 가지를 모두 갖춘 시스템을 구축할 것입니다.
패턴은 옳습니다. 저장 포맷으로서의 마크다운은 적합하지 않습니다. 벤더들은 이미 API 계층을 구축하고 있습니다. 아키텍처는 수렴했습니다. 이제 남은 과제는 조직들이 밸리데이션된 시스템을 AI가 활용할 수 있도록 커넥터와 지식 그래프 계층에 투자할 것인가, 아니면 여전히 PDF를 벡터 데이터베이스에 던져 넣으며 청크들이 우연히 맞아떨어지기만을 바랄 것인가의 선택뿐입니다.
참고자료 및 추가 읽을거리:
- Open Knowledge Format (OKF) v0.1 specification and reference implementations
- Karpathy’s LLM Wiki pattern
- Veeva Direct Data API documentation
- Snowflake + Veeva partnership for agentic AI in life sciences
- ISPE GAMP Guide: Artificial Intelligence (July 2025)
- PostgreSQL 19 SQL/PGQ property graph queries
- MCP for life sciences — USDM
- Veeva Vault Direct Data API Accelerators on GitHub
Saram Consulting