Nature Communications에 게재된 한 무작위 비열등성 시험은 사전학습된 언어 모델을 활용한 ‘인간+AI 보조’ 사전 스크리닝과 ‘인간 단독’ 스크리닝을 직접 비교했습니다. 비소세포폐암 및 대장암 환자 355명의 의무기록을 분석한 결과, 차트 수준의 정확도는 **AI 보조 시 76.1%, 인간 단독 시 71.5%**로 나타났습니다 (우월성 p = 0.002).

이것이 현재 이 분야에서 확보된 가장 강력한 무작위 배정 실증 증거입니다. 정확도 4.6%포인트 향상입니다. 그리고 이 결과에는 기사화되는 과정에서 거의 항상 누락되는 두 가지 중대한 전제 조건이 붙어 있습니다. 첫째, 무작위 시험이지만 사용된 의무기록은 **사후적으로 수집(retrospectively collected)**된 과거 데이터라는 점입니다. 둘째, 이 연구가 “주당 10~20명의 추가 환자를 스크리닝하는 효과를 낸다”며 시장에 널리 퍼진 주장은 해당 논문 본문 어디에도 등장하지 않는다는 점입니다.

이제 분포의 반대편 끝을 살펴보겠습니다. 2025년 Digital Health에 실린 스코핑 리뷰는 임상시험 관련 문헌을 전수 스크리닝하여 108건의 기록을 분석했습니다. 그중 시험기관 선정(site selection)에 머신러닝을 실제로 적용한 연구는 단 2건에 불과했습니다. 전체의 약 86%인 93건은 단순 사후 데이터 분석에 머신러닝을 사용했습니다. 임상 설계에 적용한 것은 19%, 환자 선별은 6%, 시험기관 선정은 2%에 그쳤습니다.

이 두 가지 객관적 사실을 벤더들의 홍보 자료에 난무하는 수치들(“3배 빠른 환자 등록”, “시험기관 선정 기간 50% 단축”, “일정 30~50% 가속화”, “1.7배 더 많은 환자 유치”) 옆에 나란히 놓아보십시오. 이 분야의 실체가 적나라하게 드러납니다. 동료 평가를 통과한 실증 증거는 규모가 작고, 사후적이며, 특정 단일 워크플로우에 편중되어 있습니다. 반면 상업적 서사는 거대하고, 자체 보고에 의존하며, 시장 어디에나 퍼져 있습니다.

이것이 임상시험 AI에 대한 증거 감사(evidence audit)가 필요한 이유입니다.

 증거 성숙도: 실제로 무엇이 입증되었는가
 (막대 길이는 효과의 크기가 아니라 증거의 성숙도를 나타냄)

 사후 차트 스크리닝 정확도 향상   ████████████  무작위 배정, N=355, 4.6%p 향상
 스크리닝 소요 시간 단축         █████████░░░  의사 2인 대상 파일럿 사용자 연구
 메타분석 통합 스크리닝 민감도    ████████░░░░  단계별 0.70~0.92 편차 큼
 시험기관 선정에 ML 실제 적용     ██░░░░░░░░░░  108건 문헌 중 2건에 불과
 전향적 환자 치료 결과 개선       ░░░░░░░░░░░░  확인된 실증 연구 없음

실제로 입증된 성과들

환자-임상시험 매칭은 검증된 유일하게 성숙한 응용 분야입니다. 표준적 레퍼런스 시스템은 TrialGPT(Jin et al., Nature Communications 15, 9074)이며, 보고된 개별 수치들은 엄밀히 검증됩니다:

지표 / 항목 실증적 상태
기준(criterion) 단위 판별 정확도 0.873 검증 완료 — 전문가 집단의 0.887~0.900에 근접
전체 데이터의 6% 미만을 탐색하여 관련 임상 90% 이상 재현(recall) 검증 완료
스크리닝 소요 시간 42.6% 단축 검증 완료 — 단, 의사 2명이 참가한 파일럿 연구
순위화/제외 성능 베이스라인 대비 43.8% 우수 검증 완료
문장 단위 근거 설명 제공 검증 완료 — 근거 문장 위치 식별 F1 88.6%
3인의 도메인 전문가가 검증한 1,015개 환자-기준 쌍 평가 검증 완료
“ChatGPT-4.0 단독으로 의사들과 88% 일치도 달성” 논문에 없음 — 2차 출처의 왜곡된 인용

마지막 행은 업계의 왜곡 패턴을 압축해 보여줍니다. 실제 TrialGPT의 수치는 전문 도메인 시스템이 0.873을 달성하여 인간 전문가(0.887~0.900)에 육박했다는 정직하고 방어 가능한 성과입니다. 그러나 시장에서 회자되는 버전은 엉뚱한 범용 상용 모델에 귀속된 단편적인 88% 수치로 둔갑해 있습니다.

또한 같은 논문의 183명의 가상 환자와 75,000건 이상의 적격성 주석은 1,015개 수치와 모순되는 것이 아닙니다. 3개 공개 코호트에 대한 전체 평가 규모이며, 1,015쌍은 매칭 모듈을 정밀 채점하기 위해 수작업 주석을 단 하위 세트입니다.

통합 메타분석의 올바른 해석. 2026년 발표된 스코핑 리뷰 및 메타분석(J Clin Transl Sci 10(1):e98)은 21,573건의 문헌을 검토하여 121개 연구를 포함시켰으며, 스크리닝 통합 민감도를 0.91 (95% CI 0.84~0.95)로 보고했습니다. 그러나 인용 과정에서 흔히 누락되는 핵심은 업무 단계별 이질성입니다. 적격성 식별(identification) 단계의 민감도는 0.80, 적격성 *분류(classification)*는 0.92, 코호트 식별은 0.70에 불과했습니다. “AI 환자 모집 민감도 0.91”이라는 단일 수치는 20%포인트 이상 차이 나는 서로 다른 작업들을 뭉뚱그린 착시입니다.

주목할 만한 실제 현장 연구. 대규모 지역 암 진료 네트워크에서 진행된 패러다임 헬스(Paradigm Health)의 ASCO 2025 발표에 따르면, 비정형 임상 기록에 대해 LLM 추론을 적용한 결과 4개 시험 중 3개에서는 스크리닝 대상 환자 수를 31~87% 줄여 불필요한 차트 검토를 대폭 감소시켰습니다. 반면 4번째 시험에서는 대상자 수가 오히려 32% 증가하여 최종 적격 환자 수가 2배로 증가했습니다. 위양성을 줄이는 케이스와 위음성을 줄이는 케이스가 공존함을 솔직히 보여주는 귀중한 실제 데이터입니다.

출처 이력의 심각한 붕괴 (The Provenance Problem)

이 분야는 조사했던 다른 어떤 AI 영역보다 출처의 왜곡이 극심합니다. 컨설팅 보고서, 벤더 웹사이트, 언론 기사에 반복되는 다음 4가지 핵심 통계는 추적 가능한 1차 출처가 전혀 존재하지 않습니다:

주장 내용 추적 결과 및 실체
머신러닝이 임상 일정을 30~50% 단축하고 비용을 최대 40% 절감하며 등록을 65% 개선함 1차 문헌 인용 없이 이 수치들을 나열한 2026년의 단 한 편의 서술적 총설(narrative review)로 귀결되며, 벤더들이 이를 그대로 복제함
시험기관 선정 예측 정확도 45% → 75% 개선, 타당성 계획 수립 812주 → 46주 단축 원천 출처 전무. 벤더 웹사이트마다 각기 다른 숫자를 기재함
임상시험 데이터의 **68%**가 비정형 데이터임 출처 없음. “시험기관의 68%가 등록 목표 달성에 실패한다”는 오랜 통계와의 혼동으로 추정
의료기관당 EHR 연동 비용 25만~50만 달러, 소요 기간 6~8개월 이 수치 조합의 출처는 어디에도 존재하지 않음

더욱이 다음 두 가지 대표 통계는 **명백한 허위(False)**입니다:

“노바티스와 IBM 왓슨이 스크리닝 정확도를 45%에서 78%로 향상시켰고, 스크리닝 시간을 94%(8시간에서 30분) 단축했다.” 실제 논문(Haddad et al., JCO Clinical Cancer Informatics 2020)에서 “78%“는 정확도가 아니라 시간 단축 비율이었습니다 (3개 시험 90명 환자 대상, 110분에서 24분으로 단축). 정확도는 민감도 9195% 및 특이도 7699%였습니다. 94%, 8시간, 30분이라는 숫자는 논문에 존재하지 않습니다.

“Lo et al., PNAS 2020 논문이 임상 성공 예측에서 약 93% AUC를 달성했다.” 해당 논문은 Lo, Siah & Wong이 Harvard Data Science Review 1.1에 발표한 논문으로, PNAS가 아니며 2020년이 아니라 2019년 10월 논문입니다. 보고된 실제 AUC는 0.78(2상→승인) 및 0.81(3상→승인)이었습니다. 게다가 사용된 입력 특성에는 사후적 결과인 시험 상태, 등록률, 소요 기간 등이 포함되어 있어 사전 예측 모델이라 보기 어렵습니다.

완전히 거꾸로 뒤집힌 유명한 사례. “메이요 클리닉에서 임상 매칭용 IBM 왓슨이 실패함으로써 AI 임상시험의 실패가 알고리즘이 아닌 데이터 파이프라인의 실패임을 증명했다”는 업계의 유명한 우화는 완전한 거짓입니다. 메이요의 임상시험 매칭 프로젝트는 유방암 환자 등록률을 80% 증가시키며 성공으로 보고되었습니다. 언론을 장식했던 실패작은 2018년의 **왓슨 포 온콜로지(Watson for Oncology)**라는 완전히 다른 제품이었습니다. 두 제품이 수년간 혼동되면서 실증 기록과 정반대되는 교훈을 퍼뜨려 온 것입니다.

시험기관 선정: 벤더들의 홍보 수치 vs 두 편의 사후 연구

시장의 대다수 수치는 검증되지 않은 자체 보고입니다:

기업 / 기관 주장 내용 실제 성격
Amgen ATOMIC 상위 선정 기관에서 3배 빠른 등록 2025년 암젠 자체 홍보; 13개 연구 대상 사내 분석
AbbVie 등록 목표를 달성하는 시험기관 50% 이상 증가 2023년 학회 발표; 방법론 미공개
McKinsey 상위 등록 기관 +3050%, 전체 등록 +1015% 파일럿 프로젝트 기반 컨설팅 분석
Parexel 시험기관 선정 속도 50% 가속 벤더 보도자료
Novartis 4~6주 소요되던 과정을 2시간 회의로 단축 로이터 통신을 통한 기업 자체 주장
IQVIA 개시 속도 33% 단축, 환자 수 1.7배 확보 벤더 보도자료

반면 동료 평가를 통과한 학술 연구는 훨씬 정직한 한계를 드러냅니다.

FRAMM (Patterns 2024)은 형평성을 고려한 탁월한 연구입니다: 특정 소수 집단 등록률을 최대 **20% 향상(히스패닉 +14%, 흑인 +27%, 아시아계 +60%)**시켰습니다. 그러나 이는 과거 4,392건의 이전 임상 데이터를 대상으로 평가된 것이며 저자들 스스로 “사례 연구이자 개념 증명”이라고 명시했습니다.

시험기관 위험도 예측 모델 (Int J Med Inform 2026)은 내부 분할과 외부 분할의 차이를 극명하게 보여줍니다. 이 연구는 98.91%의 놀라운 정확도로 92개 기관 중 91개를 올바르게 분류했다고 보고했습니다. 그러나 92개 기관은 내부 검증용 데이터셋이었습니다. 89개 뒤센 근이영양증 연구의 761개 기관을 대상으로 한 외부 검증에서는 정확도가 **81.21%**로 급락했습니다.

이를 업계 전체의 일반 법칙으로 삼아야 합니다: 동일한 프로그램의 데이터에서 분할해 측정한 수치는 단순 내부 적합도 통계입니다. 외부 코호트에서 측정한 수치만이 진정한 성능 예측치입니다.

임상 설계 측면: 하나의 실질적 성과와 하나의 조작된 통계

Trial Pathfinder (Nature 2021)는 실질적이고 중요한 성과입니다: 10건의 3상 비소세포폐암 임상을 61,094명의 Flatiron 실제 환자 데이터와 비교하여, 검사 수치 제외 기준을 완화했을 때 대상 환자 풀이 “2배 이상 증가”할 수 있음을 증명했습니다. 그러나 “위험비(hazard ratio)에 아무런 변화가 없었다”는 세간의 설명은 틀렸습니다. 데이터 기반 기준 확장은 전체 생존율(OS) 위험비를 평균 약 0.05 감소시켰습니다. 미미하지만 유리한 방향이었으며 결코 0이 아니었습니다.

AMARANTH는 임상 설계 분야에서 가장 강력한 성과입니다. 라나베세스타트(lanabecestat) 알츠하이머 임상은 무용성(futility) 판정을 받고 실패했습니다. 그러나 기저 시점(baseline) 데이터만을 활용해 환자들을 해석 가능한 예후 모델로 재계층화한 결과, 느린 진행 하위군에서 인지 기능 저하가 46% 지연되는 강력한 신호가 발견되었습니다. 실패한 임상에서 더 나은 계층화를 통해 실제 유효성 신호를 구출해낸 이 사례야말로, AI가 단순 운영이 아니라 임상 설계 단계에 반드시 도입되어야 함을 보여주는 가장 설득력 있는 증거입니다.

반드시 지적해야 할 허위 통계. “백혈병 1차 치료 임상시험 기준의 50%가 알려진 약물 안전성 프로파일과 불일치했고, 30%는 과도하게 관대했으며 10%는 과도하게 제한적이었다”는 유명한 인용문은 원문으로 지목된 Haematologica 논문에 전혀 존재하지 않습니다. 실제 논문은 빌리루빈 68.4%, 신기능 68.4% 등의 구체적 일치도를 보고하며, 검사 기준이 실제 안전성 데이터보다 엄격했던 비율이 **51~76%**에 달했다고 기술했습니다. 누군가 기억하기 쉬운 숫자로 말을 지어냈고, 그것이 업계 전반에 무비판적으로 복제되어 온 것입니다.

규제 현황과 오류 교정

이 분야에서 흔히 틀리게 인용되는 5가지 규제 일정과 현황입니다.

규제 도구 / 가이드라인 올바른 현황 및 주의사항
FDORA 다양성 실행 계획 (DAP) 법적 요구 자체는 유효함 (2022년 12월). ⚠ 그러나 초안 가이드라인은 2024년 6월에 나왔고, FDA는 2025년 1월 이를 전격 철회했습니다. 최종화된 적이 없으므로 DAP 가이드라인을 현재 유효한 지침으로 다루지 마십시오
FDA 적격성 기준 가이드라인 ⚠ **“임상시험 참여 확대(Enhancing Participation in Clinical Trials)” 가이드라인은 2025년 12월 15일에 최종 확정(FINAL)**되었습니다. 2024년 9월에는 어떠한 적격성 가이드라인도 발행된 적이 없습니다
ICH E6(R3) 4단계 공식 채택: 2025년 1월 6일 (원칙 및 부속서 1). 분산형 임상 및 실사용 데이터를 다루는 부속서 2는 2026년 6월 3일에 채택됨
ICH M11 (전자 구조화 프로토콜) ⚠ 2025년 11월 19일 채택되었으며, FDA의 연방관보 고시는 2026년 5월 22일이었습니다. “2026년 5월 최종화”가 아닙니다
FDA 전산화 시스템 가이드라인 ⚠ 치명적인 함정. 1999년 “임상시험에 사용되는 전산화 시스템” 가이드라인은 **2007년 5월 가이드라인으로 완전 대체(superseded)**되었습니다. 1999년 문서를 현행 지침으로 인용하는 것은 명백한 오류입니다
PROCOVA (디지털 트윈 대조군) EMA CHMP 적격성 의견 채택은 2022년 9월 20일로 맞습니다. ⚠ 그러나 “FDA의 동의”는 과장되었습니다. FDA는 ISTAND 의향서를 반려했으며, 단지 ANCOVA의 특수 사례로서 가이드라인을 벗어나지 않는 것으로 보인다고만 언급했습니다. 또한 “대조군 40% 감축”은 언런(Unlearn)의 자체 알츠하이머 주장이며 EMA 의견서에는 질환 무관 최대 **15%**로 명시되어 있습니다
FDA AI 실시간 검토 파일럿 2026년 4월 28일 발표, 환자 모집 개선 및 안전성 모니터링을 명시적으로 포함하며 아스트라제네카 및 암젠과 2건의 개념 증명 임상 진행 중

진정한 규제적 시사점: 환자 식별(identification)은 병목이 아닙니다. 동의서 획득 의향, 임상 물류, 의료진에 대한 신뢰, 그리고 누락된 검사 수치나 조직 검사 기록 같은 적격성 문서화가 진정한 병목입니다. 단순히 차트 검토 시간을 줄여주는 매칭 도구는 곧 다른 현실적 벽에 부딪힙니다.

주의할 점: 공정성(Fairness)에 관한 수학적 불가능성 정리는 엄연한 사실입니다(Kleinberg et al., Chouldechova). 유병률이 다를 때 캘리브레이션과 위양성/위음성 균형은 양립할 수 없습니다. 그리고 환자 순응도/유지(retention) 예측 모델은 환자를 임상에서 배제하기 위해서가 아니라, 교통편 지원이나 원격 방문 제공 등 환자를 지원하기 위한 목적으로만 사용되어야 합니다.

임상시험 AI 도입/구축을 위한 7가지 수칙

  1. 정확도 수치를 보기 전에 외부 밸리데이션 분할 여부를 요구하십시오. 내부 98.91%가 외부 81.21%로 떨어집니다. 이것이 현실의 표준 비율입니다.
  2. ’무작위 배정’과 ’전향적(prospective)’을 혼동하지 마십시오. 이 분야 최고 수준의 논문도 사후 수집된 차트에 기반한 무작위 배정입니다. 방법론적 엄밀성은 높지만 시간적 타당성은 제한적입니다.
  3. 벤더들의 백분율 수치를 검증되지 않은 가설로 취급하십시오. 암젠, 애브비, 파렉셀, 아이큐비아, 매킨지, 노바티스의 수치는 모두 자체 보고이며 독립 검증을 거치지 않았습니다.
  4. 알고리즘보다 학습 데이터의 접근 권한을 먼저 확인하십시오. 사이트 EHR 데이터 접근권이야말로 진정한 해자이자 실패의 주원인입니다.
  5. 모델 전체가 아니라 사용 맥락(Context of Use)에 맞춰 밸리데이션하십시오. 데이터 매니저를 위한 문서 분류와 코디네이터를 위한 적격성 판별은 위험 등급이 다릅니다.
  6. 프로세스 변화 후에도 살아남는 지표를 측정하십시오. 스크리닝 탈락률, 첫 환자 등록까지의 시간(FPI), 환자당 쿼리 수, 프로토콜 일탈률, 등록 환자 다양성 등 결과 중심 지표여야 합니다.
  7. 기존 비즈니스 케이스의 인용 통계를 자체 감사하십시오. 가장 빈번히 등장하는 ’30~50% 일정 단축’과 ’45%→75% 정확도 향상’은 출처가 없는 허구의 숫자입니다.

결론 (The Bottom Line)

임상시험 분야의 머신러닝은 실재하며 가치 있는 도구이지만, 마케팅이 주장하는 규모보다는 훨씬 작습니다. 가장 성숙한 응용 분야는 환자-임상 매칭이며, 무작위 시험으로 입증된 정직한 효과 크기는 약 4.6%포인트의 정확도 향상입니다. 실패한 임상의 구조적 구출이나 시험기관 위험도 평가 같은 설계 측면의 성과들은 대단히 유망하지만 거의 전적으로 사후 분석에 머물러 있습니다.

분자 설계, 가상 세포, 그리고 임상시험에 이르기까지 일관된 패턴이 관찰됩니다: 생성 및 예측 능력은 검증 능력을 한 자릿수 이상 앞질러 나갔으며, 그 거대한 간극은 아무도 검증하지 않은 허구의 통계들로 메워져 있습니다.

진정으로 필요한 작업은 화려하지 않습니다. 독립된 외부 코호트, 캘리브레이션 보고서, 엄격한 출처 추적성, 그리고 모델이 내린 판단에 책임을 지는 지정된 인간 전문가입니다. 통합 민감도 0.91 뒤에 숨은 실질적 효과가 4.6포인트인 분야에서, 이러한 엄격한 규율만이 허황된 주장과 진정한 기술 역량을 가르는 유일한 기준입니다.


관련 기사: 86개 중 2개: AI 바이오마커 발굴에 내재된 밸리데이션 결손 · 표현은 해결되었으나 시뮬레이션은 미완이다: AI 가상 세포의 현주소 · 117개 AI 개발 신약 파이프라인, 승인은 0건

출처 및 참고 문헌: TrialGPT, Nature Communications 15, 9074 (2024) · 무작위 사전 스크리닝 임상, Nature Communications 17, 2306 (2026) · Bian et al., JCO Clinical Cancer Informatics 2025 · Yin et al., J Clin Transl Sci 2026;10(1):e98 · Paradigm Health, ASCO Quality Care Symposium 2025 · Kanapari et al., Digital Health 2025 · FRAMM, Patterns 5(3), 2024 · Yang, Int J Med Inform 2026;211:106314 · Trial Pathfinder, Nature 592:629–633 (2021) · AMARANTH, Nature Communications 16:6244 · Haddad et al., JCO Clinical Cancer Informatics 2020 · Lo, Siah & Wong, Harvard Data Science Review 1.1 (2019) · Kleinberg et al., arXiv:1609.05807 · Chouldechova, Big Data 2017 · FDA: 2025년 12월 적격성 가이드라인 최종본; ICH M11 고시 (91 FR 30310); AI 파일럿 공고 (91 FR 23100); 2007년 전산화 시스템 지침 (72 FR 26638) · ICH E6(R3) (2025년 1월 6일 및 부속서 2) · PROCOVA EMA 적격성 평가 (2022년 9월 20일).

연구 노트: [[ML-Clinical-Trials-Evidence-Audit-2026]]