5개의 대형 언어 모델이 상호 치열하게 논쟁하며 임상시험계획서(프로토콜)를 다듬어 나갑니다. 총괄(Supervisor) 에이전트가 업무를 분배하고, 시험설계(Trialist) 에이전트가 초안을 잡으며, 정보학(Informatician) 에이전트가 이를 실사용 데이터(RWD)와 매핑합니다. 임상의(Clinician) 에이전트는 환자 적격성 기준의 현실성을 검증하고, 통계학자(Statistician) 에이전트는 통계 분석 계획의 타당성을 집요하게 심문합니다. 이들은 프로토콜이 빈틈없이 완성될 때까지 생성과 비판, 재작성을 끊임없이 반복합니다.
이 시스템의 이름은 EmulatRx입니다. 2026년 7월 Nature Communications에 게재되었으며, 현재 임상시험 AI 응용 계층에서 기술적으로 가장 진지하고 정교한 결과물입니다. 그러나 저자들이 투명하게 밝히고 있듯이, 이 시스템은 기존의 실사용 데이터에 기반한 사후적(retrospective) 사례 연구로만 평가되었습니다. MIMIC-IV 중환자 데이터, 그리고 뉴욕시 5개 의료기관의 알츠하이머 및 파킨슨병 데이터가 사용되었습니다. 이 시스템이 생성한 프로토콜을 바탕으로 실제 전향적(prospective) 임상시험이 진행된 사례는 단 한 건도 없습니다.
이 첫 문단에 담긴 두 가지 사실이 업계 전체의 실상을 압축합니다. 임상시험 현장에 실제로 배포되어 운용 중인 AI 응용 계층을 뜯어보면, 매우 일관되고 기계적인 패턴이 드러납니다:
기능 자체에 대한 주장(Capability claims)은 검증됩니다. 그러나 효과의 크기에 대한 주장(Magnitude claims)은 검증되지 않습니다.
시스템은 실재합니다. 기업들의 공식 발표도 사실입니다. 그러나 몇몇 훌륭한 예외를 제외하면, 그 발표에 따라붙는 화려한 수치들은 뒷받침하는 방법론이 전혀 없거나 1차 출처가 아예 존재하지 않는 기업의 자체 홍보 문구에 불과합니다. 심지어 2026년 시중에 유통되는 임상시험 AI 관련 통계의 상당수는 1차 연구 인용 없이 숫자만 나열한 단 한 편의 총설 논문으로 거슬러 올라가며, 벤더들이 이를 복사하여 마케팅 자료로 재활용하고 있습니다.
배포된 응용 계층을 층위별로 분해한 실체는 다음과 같습니다.
응용 계층별 증거의 위상과 성숙도
구조화된 데이터로서의 프로토콜 ── 동료 평가 논문 EmulatRx, Nat Commun 2026
│ (사후적 평가 데이터셋)
▼
연산 가능한 적격성 기준 ── 동료 평가 논문 Lee 2024 (정밀도 0.91 / 재현율 0.79)
│
▼
코호트 시뮬레이션 / TTE ── 동료 평가 논문 Nat Commun 2023, 2025
│ (RWD 기반 인과추론 프레임워크)
▼
환자-임상시험 매칭 ── 동료 평가 논문 사후 수집 차트 대상의
│ 무작위 배정 임상 1건 확인
▼
시험기관 순위화 ── 108건 중 2건; 그 외 전부는 벤더 자체 주장
│
▼
모니터링 / RBQM ── 임상 표준 실무; 결합된 수치들은
벤더들의 미검증 자체 보고
프로토콜은 이제 모델이 반복 최적화할 수 있는 데이터 객체가 되었다
2026년에 들어서야 에이전트 기반 프로토콜 정교화가 현실화된 이유는 모델이 갑자기 비약적으로 똑똑해졌기 때문이 아닙니다. 프로토콜 자체가 기계 가독형(machine-readable) 데이터로 진화하기 시작했기 때문입니다.
ICH M11 (임상 전자 구조화 조화 프로토콜) 가이드라인이 2025년 11월 19일 공식 채택되었고, 2026년 5월 22일 FDA의 관보 고시가 뒤따랐습니다. M11은 단순한 문서 서식이 아닙니다. 가이드라인, 표준화된 템플릿, 기술 사양이 결합된 프레임워크이며, 그 목적은 프로토콜 정보의 원활한 전자적 교환입니다. 여기에 분산형 요소와 실사용 데이터를 규정한 ICH E6(R3) 부속서 2(2026년 6월 3일 채택)가 나란히 맞물렸습니다.
이 두 규제 도구를 에이전트 시스템 옆에 놓으면 아키텍처의 필연성이 보입니다. 타입이 지정된 필드를 지닌 구조화된 객체로서의 프로토콜은 질의할 수 있고, diff 비교가 가능하며, 가상 코호트에 시뮬레이션할 수 있고, 에이전트별로 분담하여 개정할 수 있습니다. 140페이지짜리 정적 PDF 문서로는 불가능했던 일입니다.
EmulatRx의 아키텍처는 향후 업계가 모방하게 될 표준 템플릿입니다. 인간 피드백 기반 강화학습(RLHF)이 적용된 그래프 런타임 위에서 5개의 역할 분화 에이전트가 작동하며, 정적 지식 베이스가 아니라 동적 RWD 소스를 직접 순회합니다. 모델의 종류보다 중요한 것은 도메인 역할의 분리입니다. 적격성 기준 검토와 통계적 검정력 검토를 서로 다른 에이전트에게 맡김으로써, 규제 문서 작성 시 LLM이 저지르는 가장 흔한 실패—문장은 유려하고 내적으로 일관되나 현장 운영상 물리적으로 불가능한 계획서 작성—를 효과적으로 차단합니다.
다만 이 시스템에 아직 전향적 임상 검증 팔(arm)이 없다는 점은 이 계층 전체가 공유하는 한계입니다.
타겟 임상시험 에뮬레이션: 응용 계층이 가장 흔히 건너뛰는 인과추론 방법론
실사용 데이터(RWD)로부터 특정 치료법에 대한 인과적(causal) 결론을 도출하려면 이를 올바르게 수행하기 위한 확립된 프레임워크가 필요하며, 이는 결코 새로운 개념이 아닙니다.
**타겟 임상시험 에뮬레이션(Target Trial Emulation, TTE)**은 하버드의 미겔 에르난(Miguel Hernán)과 제임스 로빈스(James Robins)가 American Journal of Epidemiology(2016)에서 정형화하고, 2022년 JAMA를 통해 임상 실무자들에게 보급한 방법론입니다. 핵심은 단순하면서도 엄격합니다: 관측 데이터를 분석하기 전에, 당신이 실제로 수행하고자 했던 가상의 무작위 배정 임상시험 계획서(적격 기준, 치료 전략, 배정 방식, 추적 관찰 기간, 평가변수, 인과적 대비)를 먼저 완벽히 문서화한 뒤, 관측 데이터를 통해 그 프로토콜을 명시적으로 모사(emulate)하는 것입니다. 사양으로부터의 모든 이탈은 문서화되고 감사 가능한 결정이어야 합니다.
신뢰할 수 있는 RWD 연구들은 모두 이 프레임워크에 기반하고 있으며, 단순 대시보드가 아니라 진정한 과학의 형태를 띱니다:
- 인구 집단 수준의 알츠하이머 약물 재창출. 2개 실사용 데이터 저장소(OneFlorida EHR 및 MarketScan 보험 청구, 10년 이상 축적된 1억 7,000만 명 이상의 환자 데이터)를 대상으로 대규모 처리 TTE를 수행하여 판토프라졸, 가바펜틴, 아토르바스타틴, 플루티카손, 오메프라졸 등을 재창출 후보로 발굴했습니다 (Nat Commun 2023). 사후적 가설 생성 연구로서 정직하게 설계되었습니다.
- 패혈증에서 환자 궤적별 코르티코스테로이드 반응 계층화. 1단계로 장기 부전 하위 표현형을 학습한 후 그 안에서 타겟 임상을 에뮬레이션하여, 코르티코스테로이드 투여와 사망률 간의 연관성이 예측된 질병 궤적에 따라 달라지며 코호트 간에도 차이가 있음을 규명했습니다 (Nat Commun 2025). 사후 다기관 개념 증명 연구로 명시되었습니다.
솔직한 실무적 시사점: 벤더가 실사용 데이터로부터 치료 효과를 추정했다고 주장한다면, 반드시 타겟 임상시험 계획서(Target Trial Specification)를 요구하십시오. 이를 제시하지 못하는 솔루션은 인과추론을 수행하는 것이 아닙니다. 인과적 어휘를 빌려 단순 검색과 순위화를 돌리고 있을 뿐입니다. 이 차이는 해당 산출물이 규제 의사결정을 뒷받침할 수 있는지, 아니면 단순한 사내 참고 자료에 불과한지를 결정합니다.
타겟 임상시험 계획서 — 벤더에게 반드시 요구해야 할 항목
적격성 기준 ──┬── 대상자 선정 기준 (누가 포함되는가)
└── 제외 기준 및 근거 데이터 (누가 제외되는가)
치료 전략 ── 비교군(대조군)을 포함한 구체적 개입 전략
배정 방식 ── 무작위 배정이 어떻게 모사되었는가 (어떤 교란 요인을 가정했는가)
추적 관찰 ── 시작 시점, 종료 시점, 중도절단(censoring) 규칙
평가변수 ── 측정하고자 하는 명확한 인과적 대비 (causal contrast)
통계 분석 ── 사전에 지정된 통계적 추정량(estimator)
인용할 가치가 있는 두 가지 환자 계층화 연구
드물게 진정한 외부 코호트를 갖춘 연구
급성 호흡곤란 증후군(ARDS), npj Digital Medicine, 2021. Schwager 연구팀은 Philips eICU 연구 데이터베이스(약 318만 건의 ICU 입원 기록)에서 51,555명의 ARDS 환자를 추출하고, 220개 변수에 걸쳐 12개 아키텍처를 테스트하여 환자들을 급속 사망, 자연 회복, 장기 입원의 3개 결과 하위군으로 계층화했습니다. 최고 성능은 다중 클래스 그래디언트 부스팅 모델이었습니다.
보고된 AUC는 0.77이었습니다. 세부 수치는 내부 검증 0.768, 외부 독립 코호트 0.751이었습니다.
두 번째 숫자를 흘려보내지 마십시오. 임상 머신러닝 문헌에서 완전히 독립된 외부 검증 코호트를 보고하는 연구는 멸종 위기종에 가깝습니다. 내부 0.768이 외부 0.751로 떨어지는 완만하고 현실적인 성능 감쇄야말로 실제 작동하는 진짜 모델의 모습입니다.
다른 것을 측정하고 있는 유명한 통계
3상 전립선암 연구, Algorithms, 2021. Beacher 연구팀은 3상 임상시험의 결과를 76%의 정확도로 예측했다고 보고했습니다. 이 숫자는 현재 머신러닝이 임상시험 성공 여부를 미리 예측할 수 있다는 증거로 널리 인용되고 있습니다.
그러나 연구 방법을 뜯어보면 세 가지 전혀 다른 사실이 드러납니다:
| 76% 정확도의 실제 실체 | 상세 내용 |
|---|---|
| 외부 검증이 아님 | 내부 층화 10겹 교차검증 결과입니다. 무작위 확률은 54%였습니다 |
| 외부 검증 시 급락 | 2개 연구로 학습하고 3번째 연구에서 외부 테스트한 결과는 **70%**로 떨어졌습니다 |
| 임상시험 단위 예측이 아님 | 기저 시점 데이터를 통해 개별 환자의 2년 차 양호/불량 반응 상태를 예측한 것이지, 임상시험 전체의 성공 여부를 예측한 것이 아닙니다 |
| 소규모 표본 | Project Data Sphere의 아스트라제네카 3상 비칼루타미드 시험 3건, n = 3,653에 불과합니다 |
마지막 행이 가장 중요합니다. 어떤 환자가 약물에 반응할지 선별하는 도구는 환자 계층화 도구입니다. 임상 3상이 성공할지 예측하는 도구는 포트폴리오 오라클입니다. 이 둘은 실패 모드가 완전히 다른 별개의 제품이며, 벤더 홍보물에서는 슬그머니 한 문장으로 합쳐지곤 합니다.
표본 크기 감축 주장은 조작된 정수입니다
“머신러닝 기반 환자 계층화가 필요한 임상 표본 크기를 20~30% 줄여준다”는 문구는 업계 어디에나 등장하지만, 이를 보고한 1차 출처는 전무합니다.
실제 동료 평가 논문의 수치들은 서로 상이하며 대체로 더 큽니다: ARDS 연구는 최대 50% 감축을 보고했고, AMARANTH 연구는 최대 90% 감축(90% 검정력 기준 군당 762명에서 82명으로 축소)을 보고했습니다. EMA의 PROCOVA 의견서는 최대 **15%**로 명시합니다. 실제 측정치보다 작고 깔끔하게 딱 떨어지는 정수형 통계는 누군가 책상에서 요약해 쓴 문구이지 실험으로 얻어낸 결과가 아닙니다.
상용 솔루션 계층: 실재하는 발표와 근거 없는 수치들
아래의 기업 배포 사례들은 모두 실재합니다. 날짜도 확인됩니다. 그러나 같은 문장에 적힌 수치들은 확인되지 않습니다.
| 기업 / 솔루션 | 출시 내용 | 발표 일자 | 결합된 마케팅 수치 | 수치의 실제 성격 |
|---|---|---|---|---|
| ICON + Anthropic | Orbis 플랫폼에 Claude를 도입하여 시험 계획 및 실시간 등록 위험 감지 수행 | 2026년 7월 28일 | “환자 모집 최대 26% 증가, 첫 환자 등록(FPI) 24% 개선” | ⚠ 자체 보고. 고객사 경험담이라 주장하나 표본, 고객명, 방법론, 독립 검증 일체 없음 |
| TCS ADD RBQM | RACT, QTL 등 4개 AI/ML 모듈 기반 위험 기반 품질 관리 플랫폼 | 2025년 11월 24일 | 모니터링 효율 30% 개선, 시험기관 모니터링 비용 20% 절감 | ⚠ 상위 3대 제약사 단 1곳의 사례를 벤더가 인용한 수치 |
| Triomics → PRISM | 마운트 시나이 티시(Mount Sinai Tisch) 암센터에 시스템 전사적 종양 임상 매칭 배포 | 2026년 1월 8일 | 수치 미공개 | ✅ 향후 동료 평가 논문으로 임상 결과를 발표하겠다고 밝힘. 과장 없는 솔직한 태도 |
| Tempus, Deep 6 AI 인수 | EHR 기반 임상 환자 매칭 레이어 통합 | 2025년 3월 11일 | 750개 이상 의료기관, 3,000만 명 이상 환자 | 데이터셋의 물리적 규모일 뿐, 효과 크기(effect size)가 아님 |
| Inovalon Patient Finder | EHR 연동 AI 사전 스크리닝 | 2025년 2월 25일 | “2/3상 환자 모집 속도 40~60% 가속” | ⚠ 출처 불명. 보도자료, 제품 페이지 어디에도 근거가 없음 |
| AiCure H.Code | 스마트폰 컴퓨터 비전 기반 복약 확인 | 2024년 9월 | 수치 없음 | 기능성만 발표됨; 정확도 근거 미확인 |
| Microsoft Azure Trial Matcher | 환자 중심 및 임상 중심의 임상시험 매칭 GA | 상시 | 알고리즘이 **“재현율 최적화(recall-optimized)”**되었으며 **“인간 결정권자의 검토가 필수적”**임을 명시 | ✅ 벤더들에게 요구해야 할 모범적 공개 방식 |
| CluePoints IMC | MedDRA/WHODrug 자동 코딩용 에이전트 딥러닝 | 2026년 9월 | MedDRA 최대 99%, WHODrug 95% 일치; 수작업 노력 약 50% 절감 | ⚠ 자체 제품 PDF에 단서 조항 솔직 명시: “입력 데이터 품질, 신규 정보, 코딩 표준에 따라 달라짐” |
| Medidata Plus / Dot | 통합 오케스트레이션 플랫폼 (Dot 2026년 3월, Plus 2026년 7월) | 2026년 | “38,000건 이상의 시험, 1,200만 명의 환자” | ⚠ 플랫폼 성능 지표가 아니라 메디데이터의 과거 누적 이력 데이터 규모를 기술한 상용구 |
두 가지 사실을 도출할 수 있습니다.
마이크로소프트와 클루포인츠(CluePoints)는 정직한 공시의 모범을 보여줍니다. 한 곳은 알고리즘이 재현율에 편향되어 있어 인간의 최종 승인이 필수적임을 투명성 노트에 밝혔고, 다른 한 곳은 정확도 수치가 입력 품질에 좌우된다는 한계를 자체 백서에 명시했습니다. 소화할 수 없는 경영 성과를 지어내지 않았습니다. 이것이 고객사가 벤더에게 요구해야 할 표준입니다.
데이터셋의 물리적 규모가 효과의 크기로 둔갑하고 있습니다. “3,000만 명 이상의 환자 데이터 보유”는 기업의 데이터 자산이지, 그 데이터를 사용하는 AI 모델이 임상시험을 실제로 개선했다는 증거가 아닙니다. 두 사실이 한 문장에 병기되면서 전자의 신뢰성이 후자의 효과인 것처럼 소비자를 호도합니다.
아무도 실측하지 않은 통계들
벤더 및 컨설팅 자료에 사실처럼 유통되고 있으나 추적 가능한 출처가 없는 수치들입니다:
| 주장 내용 | 추적 결과 |
|---|---|
| 메디데이터 “모니터링 비용 35% 절감” | 메디데이터 1차 출처 어디에도 존재하지 않음 |
| 메디데이터 “데이터 정제 속도 50% 단축” | 원천 출처 전무 |
| 이노발론 “2/3상 환자 모집 40~60% 가속” | 검색 결과 0건 |
| “이상반응(AE) 코딩 백로그 최대 70% 감축” | 출처 없음. 가장 근접한 실제 수치는 클루포인츠의 수작업 노력 약 50% 절감임 |
| “머신러닝 계층화로 표본 크기 20~30% 축소” | 출처 없음. 실제 문헌 수치는 15%, 50%, 90%임 |
| “디지털 바이오마커로 중대한 이상반응(SAE) 20% 감소” | 출처 전무 |
| “AI 환자 모집으로 임상 지연 최대 50% 감축” | 추적 불가. 가장 근접한 수치는 스크리닝 탈락률 50% 감소임 |
| “환자 등록 65% 개선”, “임상 결과 예측 정확도 85%”, “데이터 입력 오류 30~50% 해결” | 1차 연구 인용 없이 초록에 이를 기재한 2026년 단 한 편의 서술적 총설로만 추적되며, 벤더들이 이를 앵무새처럼 인용함 |
| “데이터 무결성 문제를 4 |
동일한 총설 논문으로 추적되며, 일반 블로그와 등록 사이트 트렌드 페이지만을 참조함 |
| “EHR 데이터의 **최대 80%**가 비정형임” | 총설 수준의 일반적 추정이며 엄밀한 1차 실측치가 아님 |
| “자동화된 연구 구축으로 DB 구축 기간을 10~12주에서 수일로 단축” | 벤더들의 일방적 주장이며, 벤더 자체의 기준치조차 12~16주로 서로 불일치함 |
이 통계들의 치명적인 공통점은 11개 항목 중 대다수가 1차 근거가 없는 단 한 편의 총설 논문에서 기원했다는 점입니다. 업계가 서로의 인용을 재인용하면서 한 번도 측정된 적 없는 숫자가 글로벌 벤치마크로 둔갑했습니다.
자기모순에 빠진 시장 전망치들
널리 회자되는 두 조사기관의 시장 예측입니다:
- Fortune Business Insights: 임상시험 AI 시장 규모 38억 달러(2025) → 55억 달러(2026) → 773억 달러(2034), 연평균 성장률(CAGR) 39.14%.
- Grand View Research: 임상시험 매칭 소프트웨어 시장 2억 1,070만 달러(2025) → 5억 9,530만 달러(2033), CAGR 14.0%.
두 조사는 세부 세그먼트가 다르므로 절대 규모 차이는 납득할 수 있습니다. 그러나 성장률 차이가 25%포인트에 달합니다. 더욱이 그랜드 뷰 리서치가 불과 수개월 전(2025년 4월)에 발표했던 이전 버전에서는 **1억 8,709만 달러 → 3억 9,613만 달러 (CAGR 13.45%)**를 제시했습니다.
조사기관이 전망을 수정할 수는 있습니다. 그러나 동일한 시장 질문에 대해 상호 충돌하는 수치를 동시에 유통시키는 것은 이 자료들이 실측치가 아니라 모델링에 불과함을 보여줍니다. 8년간 39%의 복리 성장이 지속된다는 것은 AI 시장이 감당해야 할 임상시험 전체의 성장 속도보다 소프트웨어 시장이 몇 배나 빠르게 팽창한다는 비현실적인 가정입니다.
검증해 보면 형태가 바뀌는 세 가지 주장
n2c2 벤치마크 결과는 진짜이지만 데이터 연도가 틀렸습니다. 비정형 의료 기록에서 코호트를 선별하는 프롬프트 기반 LLM이 마이크로/매크로 F1 0.9061 및 0.8060을 달성한 것은 사실입니다. 그러나 이는 2018년 n2c2 데이터셋이었습니다. 2022년 n2c2에는 임상 매칭 트랙이 없었습니다. 연도를 잘못 기재하여 최신 연구인 것처럼 부당한 후광 효과를 입히는 전형적인 사례입니다.
통계학적 방법론의 엄밀함이 머신러닝으로 둔갑하고 있습니다. 순미용치료이득(Net Treatment Benefit)의 기반이 되는 계층적 복합 평가변수, 일반화 쌍체 비교, 윈-비율(win-ratio) 프레임워크는 대단히 유용합니다(Buyse 2010, JACC 2023). 그러나 이들은 빈도주의 비모수 통계학이지 머신러닝이 아닙니다. 이를 AI 성과로 둔갑시키는 것은 증거 베이스를 부풀릴 뿐 아니라, 통계 분석법과 AI 모델 밸리데이션이라는 서로 완전히 다른 규제 요구사항을 혼동하게 만듭니다.
18년 전 통계의 현행화. 종양학 임상에서 흔히 인용되는 “10,000개 이상의 활성 모집 시험 중 60%가 사이트당 5명 미만을 등록하고 20% 이상은 한 명도 등록하지 못한다”는 문구는 실제 인용 논문에 그대로 등장합니다. 그러나 그 논문은 2008년 The Oncologist 사설을 인용한 것이었습니다. 완전히 조작된 것은 아니지만, 18년 전의 낡은 현실을 마치 2026년의 현실인 것처럼 인용하는 진부화(staleness) 문제입니다. 인용 사슬이 온전하기 때문에 적발하기가 훨씬 어렵습니다.
실제로 검증된 사실: 진정한 비즈니스 케이스
이 모든 소음을 걷어내고 살아남는 실증 데이터야말로 투자를 정당화하는 진정한 비즈니스 케이스를 형성합니다.
프로토콜 개정(Protocol amendments)의 막대한 비용. 836개 임상시험계획서를 분석한 결과, **57%가 최소 한 건 이상의 중대한 개정(substantial amendment)**을 겪었으며, 2상에서는 평균 2.2회, 3상에서는 2.3회의 글로벌 개정이 발생했습니다. 1회 개정 시 직접 소요 비용의 중앙값은 2상 14만 1,000달러, 3상 53만 5,000달러였습니다. 일반적인 3상 시험에서 단 한 번의 중대한 프로토콜 개정은 약 3개월의 계획에 없던 지연을 유발합니다.
데이터 수집의 거대한 낭비. 14개 제약사의 105개 2/3상 프로토콜을 분석한 결과, 핵심 및 필수적이지 않은 부차적 절차들이 환자 1인당 수집되는 3상 임상 데이터의 최대 32.5%를 차지했습니다. 이는 연구 참여자와 시험기관이 감당하는 업무 부담의 25~30%에 해당합니다. 현재 3상 시험은 연구당 평균 596만 개의 데이터 포인트를 수집합니다.
이 두 단락을 결합하면 검증되지 않은 마케팅 수치 없이도 임상시험 AI를 도입해야 하는 완벽한 운영상의 근거가 완성됩니다: 프로토콜의 절반 이상이 수억 원의 비용과 수개월의 지연을 수반하며 수정되고 있으며, 환자에게서 수집되는 데이터의 3분의 1은 유효성 평가변수에도 안전성 평가에도 기여하지 못하고 있습니다. EmulatRx 스타일의 에이전트 기반 프로토콜 검토 및 기준 시뮬레이션은 첫 번째 문제를 해결하기 위한 것이며, 자동화된 쿼리 생성과 데이터 품질 정리는 두 번째 문제를 해결하기 위한 것입니다. 이것이 방어 가능한 현실적 투자 논리입니다.
임상시험 AI 도입/구축을 위한 7가지 수칙
- 비즈니스 케이스에서 벤더의 자체 보고 수치를 명확히 라벨링하십시오. 물려받은 수치의 대다수는 벤더 주장입니다. 이를 사용하는 것 자체가 문제는 아니지만, 검증된 사실인 양 사내에 보고하는 것은 명백한 직무유기입니다.
- 데이터셋의 규모와 효과의 크기를 엄격히 분리하십시오. “3,000만 명의 환자 데이터”는 데이터 자산일 뿐, 임상 성공률이 아닙니다.
- 모델의 출력이 환자 단위인지 임상시험 단위인지 확인하십시오. 전립선암 76% 정확도는 환자 개인의 반응 예측이지 시험의 성공 예측이 아닙니다.
- 외부 독립 코호트 데이터를 요구하십시오. 내부 0.768이 외부 0.751로 떨어지는 것이 유일하게 외부 검증을 거친 연구의 실측치입니다. 외부 수치가 없다면 단순 과적합 통계를 보고 있는 것입니다.
- 데이터셋의 연식을 감사하십시오. 2018년 n2c2가 2022년으로 둔갑하고, 2008년 종양학 추정치가 2026년 현황으로 둔갑합니다.
- 마이크로소프트와 클루포인츠가 채택한 공시 패턴을 벤더에게 요구하십시오. 모델의 한계, 재현율 최적화 여부, 책임 있는 인간 개입 지점을 명시하지 못하는 벤더는 밸리데이션된 도구를 파는 것이 아닙니다.
- 단순 매칭 엔진과 인과추론 프레임워크를 구별하십시오. 실사용 데이터로부터 치료 효과를 주장한다면 타겟 임상시험 계획서(Target Trial Specification)를 요구하십시오.
결론 (The Bottom Line)
임상시험 AI 응용 계층은 분명 진전을 이루었으며 무게중심이 이동했습니다. M11 체계 하에서 프로토콜은 기계 가독형 객체로 변모하고 있고, 다중 에이전트 시스템은 RWD를 기반으로 프로토콜을 정교화하며, 타겟 임상시험 에뮬레이션은 인과적 뼈대를 제공하고 있습니다.
그러나 전혀 움직이지 않은 것은 바로 실증 검증 계층(Verification Layer)입니다. 현장의 배포 수치는 거의 전적으로 기업의 자체 보고이며, 헤드라인 통계 뒤에 숨겨진 실제 연구 방법론은 완전히 다른 경우가 태반입니다. 11개의 핵심 통계는 아무런 근거를 대지 않은 단 한 편의 총설 논문에서 복제되었습니다.
분자 설계, 가상 세포, 바이오마커, 그리고 임상 운영에 이르기까지 결론은 하나로 수렴합니다: 기술의 역량은 진짜이지만 그 크기는 마케팅에 불과합니다. 이 간극을 메우는 것은 더 많은 모델링이 아닙니다. 독립된 외부 코호트, 문서화된 타겟 임상 명세서, 명확한 사용 맥락, 그리고 모델이 내린 판단에 책임을 지는 지정된 인간 전문가입니다.
5개의 AI 에이전트가 이제 당신의 임상시험계획서를 작성해 줄 수는 있습니다. 그러나 그 어떤 에이전트도 당신을 대신해 그 프로토콜을 밸리데이션해 줄 수는 없습니다.
관련 기사: 정확도 4점 향상과 마케팅 50점의 괴리: 임상시험 AI 증거 감사 · 117개 AI 개발 신약 파이프라인, 승인은 0건 · 86개 중 2개: AI 바이오마커 발굴에 내재된 밸리데이션 결손 · 표현은 해결되었으나 시뮬레이션은 미완이다: AI 가상 세포의 현주소
출처 및 참고 문헌: EmulatRx, Nat Commun 17:5501 (2026), DOI 10.1038/s41467-026-74501-2 · Hernán & Robins, Am J Epidemiol 2016;183(8):758–764 · Hernán, Wang & Leaf, JAMA 2022 · Zang et al., Nat Commun 14:8180 (2023) · Rajendran et al., Nat Commun 16:4450 (2025) · Schwager et al., npj Digit Med 4:133 (2021) · Beacher et al., Algorithms 14(5):147 (2021) · Finkelstein & Schoenfeld, Stat Med 1999 · Buyse, Stat Med 2010 · JACC 2023 (Net Treatment Benefit) · Curt & Chabner, The Oncologist 2008 · Getz et al., Ther Innov Regul Sci 2016 · TransCelerate/Tufts CSDD 프로토콜 데이터 수집 분석 · Olawade et al., Int J Med Inform 2026 · AMARANTH, Nat Commun 16:6244 · PROCOVA EMA 의견서 (2022) · ICON 보도자료 (2026년 7월) · TCS 뉴스룸 (2025년 11월) · 마운트 시나이 뉴스룸 (2026년 1월) · Medidata/3DS 보도자료 (2026년 2월 및 7월) · Fortune Business Insights 임상시험 AI 시장 보고서 (2026년 3월) · Grand View Research 임상 매칭 보고서 · ICH M11 (2025년 11월 채택; 91 FR 30310) · ICH E6(R3) 부속서 2 (2026년 6월 3일) · Veeva Study Builder Agent (2026년 9월).
연구 노트: [[ML-Clinical-Trials-Applied-Layer-2026]]
Saram Consulting