한 품질 관리자(Quality Manager)가 시스템에 묻습니다: “지난 2년 동안 장비 ID-442와 관련된 일탈(deviation)에서 비롯된 시정 및 예방조치(CAPA)는 무엇이며, 그것들이 효과적이었습니까?”

시스템은 다음과 같은 연결고리를 탐색(traverse)해야 합니다: 일탈 보고서 → 장비 적격성평가 연계 → 세척 밸리데이션 프로토콜 연계 → 표준작업지침서(SOP) 연계 → 규제 지적 사항 이후 최신 버전으로 개정 대체(superseded) → CAPA 생성 → 변경 관리(change control) 촉발 → 위험 평가(risk assessment) 업데이트.

어떠한 벡터 데이터베이스도 이를 수행할 수 없습니다. 임베딩 유사도 검색으로는 이 연결 사슬을 따라갈 수 없습니다. 이는 ’그래프 순회(graph traversal)’이며, 대부분의 생명과학 조직이 갖추지 못한 지식 표현(knowledge representation) 방식을 필요로 합니다.

2026년 6월 12일, Google Cloud는 정확히 이러한 문제를 해결하기 위해 설계된 사양인 Open Knowledge Format(OKF) v0.1을 공개했습니다. 이는 파편화된 메타데이터에 허덕이는 데이터 엔지니어링 팀을 위해 개발되었습니다. 그러나 해당 사양과 업계 환경, 그리고 품질 경영 시스템(QMS)의 구체적인 아키텍처를 분석한 결과 결론은 명확합니다: 이 산업의 특수성을 규정하는 규제 현실에 맞춰 포맷을 적절히 조정하기만 한다면, 생명과학 품질 문서는 OKF가 본래 설계된 목적보다 훨씬 더 완벽하게 부합하는 활용 사례입니다.

OKF의 실제 정의와 기본 구조

OKF는 의도적으로 단순하게 설계되었습니다. 지식 번들(knowledge bundle)은 마크다운 파일들로 구성된 하나의 디렉터리입니다. 각 파일은 단일 개념(concept) — 테이블, API, 메트릭, 플레이북 등 — 을 나타냅니다. 파일 경로는 해당 개념의 고유 식별자(ID) 역할을 합니다. 상단의 YAML 프론트매터는 구조화된 메타데이터를 제공하며, 본문은 일반 마크다운입니다. 파일 간의 상호 링크(cross-links)는 이 디렉터리를 하나의 그래프로 변환합니다.

---
type: SOP
title: Equipment Cleaning - Grade C/D Areas
description: Cleaning procedures for aseptic manufacturing equipment.
resource: https://veeva-vault.com/doc/00P123456
tags: [cleaning, aseptic, manufacturing]
timestamp: 2026-05-28T14:30:00Z
---

# Procedure
Standard cleaning procedure for equipment in Grade C and D
areas following [SOP-00123](/sops/SOP-00123-equipment-cleaning.md).

# Related Documents
- [Work Instruction WI-088](/work-instructions/WI-088.md)
- [Validation Protocol VP-234](/validation/VP-234.md)
- [21 CFR 211.67](/regulations/21-cfr-211.67.md)

이 사양에서 필수로 요구하는 필드는 단 하나, type뿐입니다. 그 외의 모든 필드는 선택 사항입니다. 이 포맷은 “단순한 파일들의 집합”입니다. Git 리포지토리 형태로 배포할 수 있고, 텍스트 편집기 어디서든 읽을 수 있으며, 별도의 SDK 없이도 모든 에이전트가 파싱할 수 있습니다. 파일에 cat 명령을 내릴 수 있다면 OKF를 읽을 수 있고, 리포지토리를 git clone할 수 있다면 배포할 수 있습니다.

참조 구현체(reference implementation)에는 BigQuery 데이터셋을 순회하며 모든 테이블과 뷰에 대한 개념 문서를 작성하는 정보 보강 에이전트(enrichment agent)와 그래프를 시각화하는 정적 HTML 뷰어가 포함되어 있습니다. 이제 Google Cloud의 Knowledge Catalog는 OKF 번들을 기본적으로(natively) 수집(ingest)할 수 있습니다.

생명과학이 더 적합한 활용 사례인 이유

Google은 데이터 팀을 위해 OKF를 구축했습니다. 대표적인 예시는 조인(join) 경로와 메트릭 정의를 가진 BigQuery 테이블들입니다. 이는 분명 실재하는 문제이지만, 적용 범위가 다소 좁습니다.

생명과학 품질 문서는 OKF가 다루도록 설계된 모든 요소를 갖추고 있으며, 그 이상입니다:

파편화가 훨씬 심각합니다. 데이터 팀의 메타데이터는 몇 개의 시스템에만 머뭅니다. 반면 품질 지식은 전자 품질 관리 시스템(eQMS: Veeva Vault, MasterControl, TrackWise), 실험실 정보 관리 시스템(LIMS), 전자 연구 노트(ELN), 밸리데이션 저장소, 규제 정보 데이터베이스, 공유 드라이브, 그리고 이 일을 20년간 해온 숙련된 QA 전문가들의 머릿속에 흩어져 있습니다. “제품 X 배치를 생산한 후 반응기 용기를 세척하는 현재 승인된 방법은 무엇인가?“라는 질문에 답하려는 에이전트는 서로 소통하지 않는 5개 이상의 시스템에서 컨텍스트를 취합해야 합니다.

교차 참조가 훨씬 밀접합니다. 데이터 팀의 테이블은 외래 키(foreign key)를 통해 몇 개의 다른 테이블을 참조할 뿐입니다. 반면 품질 SOP는 작업 지침서(WI), 장비 적격성평가, 밸리데이션 프로토콜, 규제 인용, 일탈 이력, CAPA 기록, 교육 매트릭스, 공급업체 문서를 참조합니다. 이러한 참조 관계는 단순한 부모-자식 관계가 아닌 8~12가지 관계 유형을 가진 복잡한 그래프를 형성합니다.

걸려 있는 위험(stakes)이 훨씬 큽니다. 에이전트가 데이터 테이블의 잘못된 버전을 검색하면 대시보드에 잘못된 숫자가 표시될 뿐입니다. 하지만 일탈 조사 과정에서 에이전트가 효력이 상실된(superseded) 구버전 SOP를 가져온다면 조사는 이미 폐기된 절차를 따르게 됩니다. 규제 환경에서 “거의 맞음”은 명백한 규정 위반(compliance violation)입니다.

문서 관리(bookkeeping) 작업이 훨씬 고통스럽습니다. 카파시(Karpathy)의 핵심 통찰 — “LLM은 지루해하지 않고, 교차 참조 업데이트를 잊지 않으며, 한 번에 15개 파일을 수정할 수 있다” — 은 품질 문서 유지 관리에 직결됩니다. 하나의 SOP가 개정되면 5개의 교육 문서, 2개의 양식, 3개의 작업 지침서, 그리고 밸리데이션 프로토콜 교차 참조 목록을 업데이트해야 할 수 있습니다. 품질 부서는 이러한 유형의 유지 관리에 수천 시간을 쏟고 있습니다. 에이전트는 바로 이러한 작업을 위해 탄생했습니다.

품질 전문가들이 이미 머릿속에 지니고 있는 지식 그래프

숙련된 QA 전문가들은 ’관계’를 중심으로 사고합니다. 일탈을 조사할 때 그들은 의미론적으로 유사한 텍스트를 검색하지 않습니다. 그들은 다음과 같은 연결 사슬을 추적합니다:

Deviation
  → Equipment involved
    → Cleaning SOP for that equipment
      → Validation protocol for that cleaning method
        → Validation report (approved/rejected)
          → Risk assessment for that process
            → Prior deviations on that equipment
              → CAPAs from those deviations
                → Change controls triggered by those CAPAs
                  → Regulatory citations governing the process

이 사슬은 그래프 순회입니다. 오늘날의 RAG 시스템 — 벡터 검색과 BM25를 결합한 정교한 하이브리드 RAG조차 — 은 이 사슬을 안정적으로 추적하지 못합니다. 벡터 임베딩은 문서 ID를 인코딩하지 못합니다. “CAPA-2024-045”와 “CAPA-2024-054”는 임베딩 모델의 관점에서는 의미론적으로 완전히 동일합니다. 키워드 검색만이 둘을 구분할 수 있습니다. 또한 평면적인(flat) 벡터 데이터베이스에는 일탈과 이에 연결된 CAPA, SOP, 장비 적격성평가 간의 관계 개념 자체가 존재하지 않습니다.

MasterControl의 AI 팀이 2025년 5월 발표한 연구 결과에 따르면, 규제 문서에서 주어-술어-목적어 트리플렛(triplet)을 추출하여 구축한 지식 그래프는 인용 네트워크 단독(2.02홉)에 비해 평균 최단 경로가 1.33홉으로 단축되었습니다. 인용을 통해 연결되지 않았던 5,014개 문서 섹션 중 무려 5,011개가 트리플렛을 통해 연결되었습니다. 품질 문서 간의 의미론적 관계는 명시적인 참조 인용보다 훨씬 더 풍부합니다.

OKF의 상호 링크 메커니즘 — 개념 파일 간의 표준 마크다운 링크 — 은 이러한 관계를 자연스럽게 포착합니다. 그래프를 탐색하는 에이전트는 인간 조사관이 밟아갈 경로와 정확히 동일한 경로를 따르게 됩니다.

GxP 환경에 맞게 조정된 OKF 번들의 형태

순정(vanilla) OKF 사양은 제약이 매우 적습니다. 필수 항목은 오직 type 필드뿐입니다. 하지만 생명과학 분야에서는 더 많은 정보가 필요합니다. 사양에서는 생산자 정의 확장(producer-defined extensions)을 명시적으로 허용하므로, OKF 규격을 준수하면서 도메인 특화 필드를 추가하는 것이 올바른 접근법입니다.

---
type: SOP
title: Environmental Monitoring of Cleanrooms
doc_id: SOP-ENV-042
version: "3.2"
status: Effective
effective_date: 2026-01-15
review_due: 2027-01-15
owner: Microbiology Department
site: [Dublin, CA]
product: [Product A, Product B]
regulatory_framework: [21 CFR Part 211, EU GMP Annex 1]
resource: https://veeva-vault.com/doc/SOP-ENV-042_v3.2
tags: [cleanroom, microbiology, gmp, iso-5]
timestamp: 2026-05-28T14:30:00Z
---

# Purpose
Define procedures for routine environmental monitoring of ISO 5 and ISO 7 cleanrooms.

# Scope
Applicable to all manufacturing areas at the Dublin facility.

# References
- [SOP-QA-001 Deviation Handling](/sops/SOP-QA-001-deviation-handling.md)
- [Environmental Monitoring Log](/forms/env-log.md)
- [21 CFR 211.42](/regulations/21-cfr-211.42.md)

# Related Deviations
- [DEV-2023-889](/deviations/2023/DEV-2023-889.md) — HVAC failure in Suite B

# Action Limits
| Grade | Alert Limit (CFU) | Action Limit (CFU) |
|-------|-------------------|-------------------|
| ISO 5 | 1                 | 3                 |
| ISO 7 | 10                | 25                |

순정 OKF 사양에 추가된 핵심 필드는 다음과 같습니다:

  • doc_id 및 version — 품질 문서에는 공식 식별자와 버전 번호가 존재합니다. 타임스탬프만으로는 불충분하며, 현재 어떤 개정판이 유효한지(effective) 알아야 합니다.
  • status — Active, Effective, Superseded, Draft, Obsolete 등. 에이전트는 폐기된 절차를 인용하지 않도록 이 상태 값을 기준으로 필터링해야 합니다.
  • effective_date 및 review_due — 규제 요건입니다. 문서는 명확히 정의된 유효 기간을 가집니다.
  • regulatory_framework — 관할 규제 요건(21 CFR Part 211, EU GMP Annex 15, ICH Q10 등)과의 연결 링크입니다.
  • resource — 밸리데이션된 eQMS 내의 서명 및 승인 완료된 원본 PDF를 가리킵니다. 이는 타협할 수 없는 절대적 요건입니다.

디렉터리 구조는 단순한 문서 유형뿐 아니라 규제 대상 엔티티를 중심으로 구성됩니다:

quality-system/
├── index.md
├── sops/
│   ├── index.md
│   ├── SOP-ENV-042-cleanroom-monitoring.md
│   └── SOP-QA-001-deviation-handling.md
├── deviations/
│   ├── index.md
│   └── DEV-2023-889-hvac-failure.md
├── capas/
│   ├── index.md
│   └── CAPA-2023-045.md
├── equipment/
│   ├── index.md
│   └── EQ-BR-99-incubator.md
├── validation/
│   ├── index.md
│   └── VP-234-cleaning-validation.md
├── regulations/
│   └── 21-cfr-211.67.md
└── products/
    └── product-a/
        └── index.md

모든 객체는 그 자체로 독립적인 지식 패키지입니다. 에이전트는 복잡하게 관계를 새로 찾아낼 필요가 없습니다. 관계는 이미 마크다운 링크 형태로 명시되어 있습니다.

규제 대상 환경을 위한 3대 절대 원칙

1. 번들은 결코 진실의 원천(Source of Truth)이 될 수 없습니다

OKF 번들은 에이전트가 소비하기 편하게 파생된 지식 계층입니다. Veeva Vault에 보관된 전자 서명된 PDF가 여전히 법적 통제 기록(legal record of control)으로 남습니다. 모든 OKF 개념 파일은 전자 서명과 감사 추적(audit trail)을 보유한 밸리데이션된 eQMS 문서를 resource 필드를 통해 역참조해야 합니다.

이는 가장 중요한 단 하나의 아키텍처적 결정입니다. 그 의미는 다음과 같습니다:

  • 에이전트는 신속한 응답과 컨텍스트 구성을 위해 OKF 번들로부터 질문에 답합니다.
  • 에이전트는 결과 검증을 위해 resource 링크를 인용합니다.
  • OKF 번들은 언제든 eQMS로부터 다시 생성될 수 있습니다.
  • 규제 기관 실사관에게 통제 문서의 증거로 OKF 파일을 보여주는 일은 결코 없습니다.

2. 생산자는 밸리데이션 대상이지만, 소비자는 아닙니다

eQMS에서 데이터를 추출하여 OKF 마크다운으로 렌더링하는 파이프라인은 GAMP 5 / CSA(컴퓨터 소프트웨어 보증) 지침에 따라 반드시 밸리데이션되어야 합니다. 밸리데이션된 시스템에서 데이터를 가져와 에이전트가 의존하게 될 결과물을 생성하기 때문입니다. 만약 생산자 파이프라인이 조치 기준(action limit) 변경을 잘못 생성(환각)하고 작업자가 이를 그대로 실행한다면, 이는 치명적인 컴플라이언스 위반입니다.

반면 번들을 소비하는 에이전트, HTML 시각화 도구, 그 위에 구축된 벡터 인덱스 등은 원본 기록 시스템이 아닌 파생 계층에서 작동하므로 매번 재밸리데이션을 거치지 않고도 빠르게 반복 개선할 수 있습니다.

3. 단순 타임스탬프가 아니라 버전과 상태가 명시적이어야 합니다

OKF의 timestamp 필드는 “마지막 유의미한 변경”만을 기록합니다. 하지만 품질 시스템에서는 version, effective_date, status, review_due가 반드시 필요합니다. 생산자는 유효(Effective) 및 대체(Superseded) 문서만을 내보내야 하며, 에이전트가 과거의 세척 시간을 인용하지 않도록 ’대체된 문서(Superseded)’임을 명확하게 표시해야 합니다.

이를 통해 가능해지는 6가지 에이전트 아키텍처

GxP에 맞게 조정된 OKF 번들이 구축되면, 기존 RAG 파이프라인의 원본 PDF 대상으로는 불가능했던 강력한 에이전트들을 배포할 수 있습니다:

1. 일탈 조사 에이전트 (Deviation Investigation Agent): 새로운 일탈 설명이 주어지면, 그래프를 순회하여 과거의 유사 일탈, 승인된 근본 원인, CAPA의 효과성 여부, 위험 평가 결론을 찾아냅니다. 산출물: 완전한 추적성을 갖춘 구조화된 조사 출발점 보고서.

2. 변경 영향 평가 에이전트 (Change Impact Agent): 규격서(specification)나 원자재 변경이 제안되었을 때, 역링크(backlinks)를 따라 이를 참조하는 모든 SOP, 밸리데이션 프로토콜, 안정성 시험, 규제 제출 자료, 제품을 식별합니다. 산출물: 사람의 검토를 위한 영향 평가 매트릭스 표.

3. 감사 준비 에이전트 (Audit Readiness Agent): “제품 A의 세척과 관련하여 기한이 지난 모든 미결(open) CAPA를 보여달라”는 요청은 벡터 유사도에 기반한 LLM의 어림짐작이 아니라, status, tags, product, review_due에 대한 정확한 프론트매터 쿼리가 됩니다. 산출물: 정확히 필터링된 구조화된 감사 보고서.

4. 문서 작성 지원 에이전트 (Authoring Assistant): 동일 제품군에서 가장 최근에 승인된 유효 SOP 3건의 구조와 검증된 표준 문구를 활용하고, 올바른 상호 교차 링크가 이미 삽입된 새로운 SOP 개정 초안을 작성합니다. 산출물: QA 검토를 즉시 진행할 수 있는 문서 초안.

5. 교육 영향 평가 에이전트 (Training Impact Agent): SOP가 변경되었을 때, ‘SOP → 교육 매트릭스 → 대상 인력’ 그래프를 순회하여 재교육이 필요한 모든 교육 기록과 인원을 식별합니다. 산출물: 재교육 대상자 배정 명단.

6. 규제 인텔리전스 에이전트 (Regulatory Intelligence Agent): 새로운 FDA 가이던스 문서가 발표되면, 규제 프레임워크 링크를 순회하여 잠재적으로 영향을 받는 SOP, 밸리데이션 프로토콜, 규격서를 식별합니다. 산출물: 규제 차이 분석(gap assessment) 보고서.

업계에서 이미 진행 중인 움직임

이것은 가상의 시나리오가 아닙니다. 이미 핵심 구성 요소들이 실제 프로덕션 환경에서 작동하고 있습니다:

MasterControl은 2025년 5월 지식 그래프 접근 방식을 발표했습니다. 규제 문서에서 주어-술어-목적어 트리플렛을 추출하여 그래프를 구축한 것입니다. 이들의 다중 에이전트 파이프라인(Ingestion → Extraction → Cleaning → Indexing → Retrieval → Story Builder)은 그라운드 트루스(ground-truth) 질문 테스트에서 5.0점 만점에 4.7점의 사실 정확도를 기록했습니다. 트리플렛 네트워크는 단순 인용 네트워크가 연결하지 못했던 문서 섹션들을 성공적으로 연결했습니다.

USDM은 2026년 1월 보고서를 통해 AI가 이제 단순 실험이 아니라 밸리데이션된 QMS 워크플로에 본격 통합되었다고 밝혔습니다. 이들은 5단계 QMS AI 성숙도 모델을 정의했습니다: Assist (AI가 컨텍스트 제시), Draft (AI가 문구 초안 제안), Correlate (AI가 시스템 전반의 관련 기록 연계), Orchestrate (사람의 승인 게이트가 포함된 에이전틱 워크플로), Continuously Assured (밸리데이션된 상태의 일환으로 AI 동작 상시 모니터링). 현재 대부분의 조직은 2~3단계에 머물러 있습니다.

Google Cloud는 감사 가능성과 추적성을 요구하는 ALCOA+ 원칙에 부합하도록 궤적 기반 메트릭(trajectory-based metrics: 완전 일치, 순서 일치, 순서 무관 일치, 정밀도, 재현율)을 갖춘 에이전틱 평가 프레임워크와 함께 OKF를 공개했습니다.

**FDA와 EMA(유럽의약품청)**는 2026년 1월 신약 개발 라이프사이클 전반에 걸친 우수 AI 실무(Good AI Practice) 공동 가이드라인 원칙을 발표하며, 규제 당국이 이러한 변화에 저항하기보다는 적극적으로 대비하고 있음을 알렸습니다.

실무적인 추진 로드맵

전체 QMS를 한 번에 OKF로 전환하려 하지 마십시오. 범위가 제한된 파일럿 프로젝트부터 시작해야 합니다:

단 하나의 도메인을 선정하십시오. 단일 사업장, 단일 제품군을 대상으로 지난 2년간의 일탈과 CAPA 기록부터 시작합니다. 이 데이터들은 가치가 높고 구조화가 잘 되어 있으며 교차 참조가 매우 풍부합니다.

생산자(Producer)를 구축하십시오. API를 통해 eQMS에서 데이터를 추출하고, 마크다운으로 렌더링하며, 관계 조인(예: “SOP-00123은 DEV-2024-1142에 의해 참조됨”, “CAPA-2024-089는 DEV-2024-1142를 종결함”)을 추출하는 LLM 패스를 실행하는 밸리데이션된 내보내기 도구입니다. 이를 CSA 지침에 따라 밸리데이션하십시오.

골든 질문(Golden Questions)으로 검증하십시오. 번들을 확장하기 전에 다음 3가지 핵심 질의를 완벽히 지원할 수 있어야 합니다:

  1. 현재 유효한 특정 SOP의 버전은 무엇인가?
  2. 특정 일탈을 종결한 CAPA는 무엇이며, 그 조치가 효과적이었는가?
  3. 제안된 변경으로 인해 영향을 받는 규격서는 무엇인가?

이 세 가지 질문을 확실히 해결한다면 비즈니스 타당성(business case)이 입증된 것입니다.

SOP 및 규격서로 확장하십시오. 완전한 상호 링크를 포함하여 핵심 문서 유형들을 추가합니다.

RAG 파이프라인을 연결하십시오. 5개의 개별 벤더 API와 씨름하는 대신 기존 에이전트 인프라가 OKF 폴더를 바라보도록 설정하십시오. 이 번들은 모든 에이전트를 위한 단일 컨텍스트 공급원이 됩니다.

더 큰 그림

Google은 OKF를 “더 나은 문서화 포맷”으로 소개했습니다. 하지만 이는 실제로는 그보다 훨씬 거대한 것입니다: 엔터프라이즈 지식과 AI 에이전트 사이의 중간 표현(Intermediate Representation, IR)입니다. 품질 지식이 이러한 형태로 변환되고 나면, 일탈 조사, CAPA 추천, 감사 준비, 규제 질의응답, 문서 작성, 교육 영향 분석, 변경 관리 분석 등 모든 에이전트가 동일한 기저 지식 계층을 공유할 수 있습니다.

품질 관리 소프트웨어 벤더들(Veeva, MasterControl, TrackWise)은 통제 문서를 관리하는 훌륭한 시스템을 구축했습니다. 하지만 이 문서들을 넘나들며 AI 에이전트가 추론할 수 있도록 해주는 상호운용성 계층(interoperability layer)은 구축하지 못했습니다. OKF가 바로 그 계층입니다. 벤더 중립적이며, 사람이 읽을 수 있고, 버전 관리가 가능하며, 에이전트가 쉽게 파싱할 수 있습니다.

포맷 자체는 어려운 부분이 아닙니다. 정말 어려운 것은 규제 환경에서 신뢰를 얻는 것, 품질 전문가들이 실제로 유용하다고 느낄 도메인 특화 규칙을 정립하는 것, 그리고 구조화된 지식을 다루는 에이전트가 신뢰할 수 있을 만큼 정확한 결과물을 산출함을 입증하는 것입니다 — 생명과학 분야에서는 “대체로 맞음”만으로는 결코 충분하지 않기 때문입니다.

그러나 그 대안 — 품질 데이터를 특정 단일 벤더에 종속시키는 또 다른 독점적 지식 그래프를 구축하거나, 벡터 데이터베이스에 원본 PDF를 무작정 밀어 넣고 청크들이 우연히 잘 맞아떨어지기만을 바라는 방식 — 은 분명 훨씬 더 나쁩니다. 생명과학 산업에는 AI를 위한 더 나은 지식 표현 방식이 필요합니다. GxP에 맞게 최적화된 OKF는 오늘날 존재하는 가장 현실적인 해결책에 가깝습니다.


OKF v0.1 사양 및 참조 구현체는 github.com/GoogleCloudPlatform/knowledge-catalog에서 확인할 수 있습니다. 카파시(Karpathy)의 LLM Wiki 패턴은 gist.github.com/karpathy/442a6bf555914893e9891c11519de94f를 참조하십시오.

관련 기사