AI 가상 세포(virtual cells) 분야에서 현재 가장 중요한 논문은 직설적인 제목을 지닌 하나의 음성적 결과(negative result) 논문입니다: 딥러닝 기반 유전자 교란 효과 예측은 아직 단순 선형 베이스라인을 넘어서지 못하고 있다 (deep-learning-based gene perturbation effect prediction does not yet outperform simple linear baselines).

실험 설계는 모델들에게 최대한 유리하도록 세심하게 맞춰져 있었습니다. Norman의 2019년 CRISPR 활성화(CRISPRa) 데이터로, K562 세포주에서 100개의 단일 유전자 및 124개의 이중 유전자 쌍 교란 데이터를 사용했습니다. 각 모델은 모든 단일 교란과 62개의 이중 교란 데이터로 파인튜닝된 후, 5개의 무작위 분할에 걸쳐 테스트 데이터로 남겨둔 나머지 62개 이중 교란 조건에서 평가되었습니다. 적대적 환경이 아닌 가장 호의적인 평가 조건이었습니다. 오차는 가장 발현량이 높은 1,000개 유전자에 대한 L2 거리로 측정되었습니다.

7개의 모델이 참가했습니다: 5개의 단일세포 파운데이션 모델(scGPT, scFoundation, scBERT, Geneformer, UCE)과 2개의 작업 특화 딥러닝 모델(GEARS, CPA)이었습니다. 이들과 대조하기 위해 두 가지 의도적으로 극히 단순한 베이스라인을 두었습니다. 바로 “변화 없음(no change)”(대조군 프로파일을 그대로 예측)과 “가산(additive)”(각 단일 교란의 로그 배수 변화량을 단순 합산) 모델이었습니다.

논문에 기록된 원문 결과는 다음과 같습니다: “모든 모델의 예측 오차는 가산 베이스라인보다 실질적으로 훨씬 높았다… 그 어떤 모델도 ‘변화 없음’ 베이스라인보다 나은 성능을 보이지 못했다.”

물론 이에 대한 진지한 반론이 존재하며, 음성적 결과만큼이나 강력하게 다루어질 가치가 있습니다. Miller 등은 Nature Biotechnology 논문에서 이러한 부정적 보고가 “모델 자체의 결함 때문이 아니라 벤치마킹 **평가 지표(metrics)**의 한계에서 기인한 바가 크다”고 반박합니다. 이들은 양성 대조군 베이스라인과 캘리브레이션 척도를 도입하여 대조군 편향과 신호 희석이라는 두 가지 결함 모드를 밝혀냈습니다. 그리고 14개 데이터셋과 최대 18개 지표에 걸쳐 “적절히 캘리브레이션된 지표 하에서는 딥러닝 모델이 평균, 대조군 및 선형 베이스라인을 능가하며, 특정 조건에서는 가산 베이스라인마저 앞선다”고 보고했습니다.

그러나 이 반론 역시 실험 결과 자체를 뒤집지는 못했습니다. 단지 측정 방식에 이의를 제기했을 뿐입니다. 이 분야의 핵심 질문이 “누구 모델이 더 큰가?“에서 “당신의 평가 지표는 적절히 캘리브레이션되었는가?“로 옮겨갔다는 사실 자체가 가상 세포 기술의 실질적 성숙도가 어디에 머물러 있는지를 정확히 웅변합니다.

가상 세포가 지향하는 정의와 실체

가장 표준적인 정의는 2024년 12월 Cell에 발표된 Bunne 등의 논문입니다. AI 가상 세포란 “분자에서 세포, 조직, 그 이상에 이르는 점진적으로 복잡한 조직화 수준에서 동적 생물학적 시스템을 표현하는 여러 상호 연결된 파운데이션 모델로 구성된 포괄적 AI 프레임워크”입니다. 이는 크게 두 가지 요소로 나뉩니다. 다양한 생물 종과 스케일을 아우르는 공유 임베딩 공간인 보편적 표현(universal representations), 그리고 in silico 실험을 실행하기 위해 해당 표현을 디코딩하거나 조작하는 네트워크인 **가상 기기(virtual instruments)**입니다.

2026년 9월 Cell에 실린 Xing & Song의 연구는 한 걸음 더 나아갑니다. 저자들은 가상 세포를 “자연적 또는 인공적 개입 하에서 세포의 생물학적 가능성을 시뮬레이션하는 행동 조건부 생성형 월드 모델(action-conditioned generative world model)“로 정의하며, 이를 “유전자 발현 교란 예측과 같은 특정 작업을 수행하는 예측형 파운데이션 모델”과 명시적으로 대조합니다.

이러한 정의의 변화를 명확히 인지해야 합니다. 이 분야에서 발생하는 혼란의 대부분이 바로 여기서 비롯되기 때문입니다. 특정 작업의 예측 모델과 범용 월드 모델은 감당해야 할 증거의 무게가 완전히 다릅니다. 현재 시장에 홍보되는 수많은 역량은 월드 모델의 화려한 어휘를 차용하고 있지만 실제 제공되는 것은 단순 작업 예측기이며, 벤치마크가 측정하고 있는 대상 역시 그 작업 예측기입니다.

 ┌─ 측정 계층 (MEASUREMENT) ──────────────────────┐
 │  scRNA-seq · scATAC · 프로테오믹스 · 공간 생물학│
 │  이미징 · 교란 스크리닝                       │
 └────────────────────────┬───────────────────────┘
                          ▼
 ┌─ 표현 계층 (REPRESENTATION) — 현재 성공적 작동 ┐
 │  공유 잠재 세포 공간 (shared latent space)     │
 │  Geneformer · scGPT · UCE · STATE              │
 └────────────────────────┬───────────────────────┘
                          ▼
 ┌─ 상태 전이 계층 (TRANSITION) — 검증되지 않음 ──┐
 │  f(상태, 교란, 맥락, 시간) → 다음 상태          │
 │  <-- 현재 단순 가산 베이스라인이 여기서 승리함  │
 └────────────────────────┬───────────────────────┘
                          ▼
 ┌─ 검증 계층 (VALIDATION) ───────────────────────┐
 │  미지의 교란 조건 · 미지의 세포 유형           │
 │  오가노이드 · 독립적 외부 코호트               │
 └────────────────────────┬───────────────────────┘

표현 계층(Representation Layer)은 성공적으로 작동하고 있다

스택의 이 부분은 실재하며, 막대한 자본이 투입되었고, 대부분 철저한 동료 평가를 통과했습니다. 검증된 주요 모델들의 규모와 현황은 다음과 같습니다:

모델 데이터 규모 및 특징 학술적 상태
Geneformer 약 3,000만 전사체, 순위값 인코딩(rank-value encoding) Nature 2023
scGPT 3,300만 개 이상의 단일 세포 Nat. Methods 2024
scFoundation 5,000만 개 이상 프로파일, 1억 파라미터, 시퀀싱 리드 깊이 인식 Nat. Methods 2024
UCE 3,600만 세포, 1,000개 이상 세포 유형, 8개 종, 신규 세포에 파인튜닝 불필요 Nature 656:183–191, 2026년 7월
TranscriptFormer 최대 1억 1,200만 세포, 12개 종, 15억 3,000만 년의 진화사 포괄 Science
STATE 1억 6,700만 관측 세포 + 70개 맥락의 1억 개 이상 교란 세포 Cell, 2026년 8월
AlphaGenome 1 Mb 서열 입력 지원, 26개 변이 효과 평가 중 25개에서 최고 성능 달성 또는 대등 Nature, 2026년 1월
C2S-Scale 270억(27B) 파라미터, LLM을 위해 세포를 텍스트로 인코딩 프리프린트 및 블로그 전용
X-Cell 49억(4.9B) 파라미터, 2,560만 교란 세포, 7개 CRISPRi 스크린 프리프린트 전용

이 표에서 세 가지 세부 사항은 화려한 숫자보다 훨씬 중요한 의미를 갖습니다.

Geneformer의 순위값 인코딩은 흔히 잘못 설명됩니다. 유전자는 세포 내 상대적 발현량 순서로 단순 정렬되는 것이 아닙니다. 전체 3,000만 세포 코퍼스 전반의 발현량으로 스케일링된 해당 세포 내 발현 순위로 정렬됩니다. 이 코퍼스 차원의 스케일링이야말로 핵심 메커니즘입니다. 하우스키핑 유전자를 억제하고 전사인자(transcription factor)를 전면에 부각시키는 역할을 합니다. 이 스케일링 과정을 설명에서 누락하면 모델의 정교한 설계가 마치 임의적인 것처럼 왜곡됩니다.

STATE의 세포 수는 모듈별로 명확히 분리해서 보아야 합니다. 1억 6,700만 개는 임베딩(SE) 모듈을 위한 관측 세포 수로, 논문에 명시된 정확한 수치입니다. 아크 연구소(Arc Institute)가 발표한 “약 1억 7,000만 개”는 이 숫자를 반올림한 것입니다. 시중에 회자되는 2억 6,700만 개라는 수치는 관측 세포 1억 6,700만 개와 교란 세포 1억 개를 임의로 합산한 파생 수치일 뿐 논문의 핵심 지표가 아닙니다. 교란 모듈에는 약 70개 맥락에 걸친 1억 개 이상의 교란 세포가 사용되었습니다.

STATE는 또한 이 분야에서 가장 흥미로운 아키텍처적 통찰을 제시합니다. 시퀀싱 분석은 필연적으로 세포를 파괴하므로, 특정 세포의 교란 전 상태를 직접 관측하는 것은 물리적으로 불가능합니다. 논문은 X₀를 “기저 세포 분포 𝒟_b에서 추출된 것”으로 수학적으로 정의합니다. 따라서 모델은 개별 특정 세포가 아니라 전체 기저 세포 집단 분포에 대한 교란 효과를 예측하도록 학습됩니다. 이는 인과적(causal) 프레임워크이며 기존 모델들보다 훨씬 정밀한 접근입니다.

이 모든 것의 기저에는 막대한 데이터가 있습니다. Arc의 가상 세포 지도(Virtual Cell Atlas)는 관측 및 교란 데이터를 합쳐 6억 개 이상의 세포를 보유하고 있습니다. Tahoe-100M은 1,100개 약물-용량 조건 하에서 50개 암 세포주로부터 얻은 1억 개의 전사체를 담고 있습니다. 여기서 정밀하게 짚고 넘어가야 할 점은, 이 1억 개의 전사체는 1억 개의 독립된 교란이 아니라 약 6만 건의 교란 실험에서 유래했다는 사실입니다. 한편 Tahoe, Arc, Biohub는 2026년 1월에 1억 2,000만 개 이상의 추가 세포와 225,000건의 교란 상호작용 데이터를 오픈소스로 공개하겠다고 발표했으나, 10월 현재 아직 정식 출시되지 않았습니다.

평가의 난제 (The Evaluation Problem)

이 부분은 대부분의 요약 보고서들이 침묵하는 영역이자, 기술의 실무 적용 가능성을 결정짓는 가장 핵심적인 부분입니다.

대회 결과가 보여준 현실. Arc의 가상 세포 챌린지 2025(Virtual Cell Challenge 2025)는 H1 인간 배아줄기세포에서 300개의 CRISPRi 교란으로 얻은 약 30만 개의 단일세포 프로파일을 평가 데이터로 사용했습니다. Arc의 자체 사후 보고서에 따르면, 모델들은 “모든 평가 지표에 걸쳐 단순한 베이스라인을 일관되게 능가하지 못했다”고 명시되어 있습니다. 우승한 팀들은 “딥러닝과 고전적 통계 특성을 결합한 방식”이었으며, “거의 모든 모델이 평균절대오차(MAE)에서 베이스라인보다 나쁜 성능을 보였기 때문에” 최상위 팀들은 “전략적으로 PDS와 DES 지표에 집중했다”고 기술했습니다.

마지막 문장을 다시 읽어보십시오. 주최 측 스스로가 자체 리더보드에서 발생한 지표 조작(metric gaming)을 솔직하게 고백하고 있는 것입니다.

인용 오류 바로잡기. “단일세포 파운데이션 모델에 대한 2025년 Nature Methods 평가 논문”으로 자주 인용되는 문헌의 실제 출처는 Genome Biology 26:101 (Kedzierska et al.)입니다. Nature Methods는 이에 대한 뉴스 하이라이트를 실었을 뿐입니다. 이 연구 자체는 약 12개의 후보 중 코드와 모델 가중치가 공개된 **단 2개 모델(Geneformer, scGPT)**만을 평가할 수 있었습니다. 이 축소 자체가 하나의 거대한 발견입니다: 벤치마크 가능한 모델은 연구진이 코드를 공개한 모델로 제한되며, 이는 공개된 부정적 연구 결과들이 코드를 충실히 배포한 성실한 모델들을 체계적으로 과다 표집하게 만든다는 뜻입니다.

데이터 분할 설계가 답을 바꿉니다. Mao 등은 6개 연구의 약 7개 데이터셋에 걸쳐 11개 방법을 벤치마킹하면서, 무작위가 아니라 파운데이션 모델의 임베딩 공간에서 세포 상태 유사도에 기반해 미지의 세포 분할(unseen-cell split)을 구축했습니다. 결과는 “무작위 분할 대비 scFM 기반 분할에서 거의 모든 방법의 성능이 저하”되었으며, 저자들은 단호한 결론을 내렸습니다: “무작위 분할은 모델이 실제보다 더 견고해 보이도록 착시를 일으킬 수 있다.”

실무에 적용해야 할 핵심 발견은 중재(intervention) 데이터입니다. Ahlmann-Eltze 연구팀은 부정적 결과를 밝히는 데서 멈추지 않았습니다. 그들은 모델들의 실패 원인이 부분적으로 사전학습 데이터가 관측 데이터(observational data) 중심이기 때문이라고 가설을 세웠습니다. 그리고 교란 데이터셋(perturbation dataset)으로 사전학습된 단순 선형 모델이 다른 모든 복잡한 모델을 일관되게 압도함을 입증했습니다. 이는 다른 세포주로 전이했을 때도 마찬가지였습니다. 저자들의 결론: 세포 지도 아틀라스 사전학습은 “무작위 임베딩 대비 미미한 이점만 제공했으나, 교란 데이터에 대한 사전학습은 예측 성능을 대폭 향상시켰다.”

이 한 문장이 전체 데이터 전략의 패러다임을 바꿉니다. 관측 세포의 수를 무작정 늘리는 것으로는 이 문제를 해결할 수 없습니다. 개입과 섭동을 가한 중재 데이터가 필수적입니다.

명확한 결과가 곧 공개됩니다. Arc의 2026년 챌린지는 **완전한 제로샷(zero-shot)**으로 진행됩니다. 대회 전용 학습 세트는 제공되지 않으며, 교란된 적이 한 번도 없는 6개의 신규 세포주를 대상으로 비표적 가이드 프로파일과 녹다운할 유전자 ID 목록만 주어집니다. 정답 라벨은 철저히 비공개입니다. 최종 테스트 데이터는 2026년 10월 22일 공개되며, 제출 마감은 11월 5일, 우승자 발표는 11월 중하순입니다. 이 분야가 2025년의 베이스라인을 진정으로 넘어섰는지는 바로 이 대회 결과에서 증명될 것입니다.

실제로 검증된 성과들

모델 / 연구 실증적 검증 상태
UNAGI: 특발성 폐섬유증(IPF)에서 니페디핀을 항섬유화제로 예측; 인간 정밀 절편 폐 조직에서 확인 동료 평가 논문 (Nat. Biomed. Eng. 2025), 그러나 동일 연구팀의 자체 검증
C2S-Scale + 실미타세르팁(silmitasertib): 학습에 없던 2개 신경내분비 모델에서 항원 제시 약 50% 증가 프리프린트 및 기업 블로그, 자체 연구진 검증
Geneformer: 109개 세포 유형의 in silico 녹아웃을 통해 GSTP1을 비소세포폐암 면역치료 저항 인자로 규명 동료 평가 논문, 단일 실험실 수행
insitro: ALS/TDP-43 질환에서 3개 표적 도출, BMS로부터 2,500만 달러 마일스톤 수령 기업 자체 발표, 구체적 표적은 비공개
ProteinTalks: 3,800만 개 이상의 시계열 단백질 측정 데이터를 바탕으로 유효성, 시너지, 내성 예측 동료 평가 논문 (Nature, 2026년 9월)
VirTues: 공간 프로테오믹스; 독립 코호트에서 항 PD-L1 반응 예측 및 무질병 생존율 계층화 입증 동료 평가 논문 — 유일하게 독립 코호트 검증을 통과한 사례
AetherCell: 안구건조증에 테리플루노마이드, 궤양성 대장염에 다비가트란 제시 미검증 프리프린트. “체내(in vivo) 검증을 거친 최초의 가상 세포 모델”이라는 주장은 어떤 근거로도 입증되지 않음

시중에 잘못 유통되는 수치 두 가지를 교정합니다: MolPhenix가 기존 표현형 모델 대비 달성한 성능 향상은 10배가 아니라 8.1배입니다. 또한 널리 인용되는 “12개월 이내에 136개 분자 도출”은 REC-617에만 해당하는 수치이며, Recursion의 REC-1245는 18개월 동안 204개의 신규 화합물이 소요되었습니다.

위 표의 형태에 주목하십시오. 단 하나의 연구를 제외한 모든 결과가 자체 연구팀 검증, 기업 자체 발표, 또는 프리프린트 상의 주장에 머물러 있습니다. 연구 자체가 나쁘다는 뜻이 아닙니다. 검증 아키텍처가 여전히 성과를 주장하는 당사자들 내부에 갇혀 있다는 것이 냉정한 현실입니다.

규제 현황 — 요약본들이 전하지 않는 진실

이 부분은 유통되는 해설들이 실제 법률 및 규제 문서와 가장 극명하게 충돌하는 지점입니다.

규제 문서 실제 법적 성격과 실체
FDA 현대화법 2.0 (FDMA 2.0) (2022년 12월 29일 제정, FDORA 제3209조) 연방식품의약품화장품법(FD&C Act) 제505(i)(1)(A)조의 “전임상 시험(동물 시험 포함)“을 **“비임상 시험(nonclinical tests)”**으로 대체하고, §505(z)조를 신설하여 비임상 시험을 in vitro, in silico, in chemico, 또는 비인간 in vivo로 정의함. 허용적(permissive) 규정이지 금지적(prohibitive) 규정이 아님 — 동물 시험을 금지하지 않았으며, “실험동물 또는 in vitro”로 명시된 21 CFR 312.23(a)(8) 규정을 직접 개정한 것도 아님
NAMs 가이드라인 초안 (CDER, 2026년 3월; 91 FR 13313) in vitro 및 in silico 신접근 방법론(NAMs)을 위한 비구속적 밸리데이션 프레임워크. NAMs를 “1차 증거”로 격상시키지 않으며, 증거의 종합적 가중치(weight-of-evidence) 내에서 활용을 장려함. 밸리데이션되지 않은 NAM이라도 고려 대상이 될 수 있음을 명시. 안전성/독성학 범위에 국한됨
“비임상 시험 용어” 직접 최종 규칙 (2026년 9월 22일; 91 FR 59988; 발효 2027년 2월 4일) 단순 용어 정비 규칙: 21 CFR 312, 314, 315, 361, 601 전반에서 “animal”을 “nonclinical”로 변경함. FDA는 “증거 기준을 변경하거나 새로운 비용을 부과하지 않는다”고 명시함
AI 신뢰성 평가 가이드라인 초안 (2025년 1월, FDA-2024-D-4689) 위험 기반 7단계 프레임워크: 질문 정의 → 사용 맥락 정의 → 모델 위험 평가 → 신뢰성 계획 수립 → 실행 → 일탈 문서화 → 적절성 판정. 여전히 초안이며 비구속적임; 안전성, 유효성 및 품질 전반을 다룸
ICH M15 모델 기반 신약 개발 (MIDD) 모델 기반 증거에 대한 일반 원칙; 국제 조화 가이드라인, 비구속적
FDA + EMA 우수 AI 실무 가이드 원칙 (2026년 1월 14일) “향후 AI 가이드라인의 기반이 될” 10대 기본 원칙; 비구속적

이로부터 도출되는 두 가지 결정적 교훈이 있습니다.

첫째, **규제의 적용 범위(scope)**입니다. FDMA 2.0, 2026년 3월 NAMs 초안, 2026년 9월 최종 규칙은 모두 비임상 ’안전성’을 다루는 법적 도구입니다. 9월 규칙은 동물 규칙(Animal Rule)과 희귀의약품 조항을 명시적으로 제외했습니다. 유효성과 질환 모델링까지 포괄하는 문서는 AI 신뢰성 가이드라인과 ICH M15뿐입니다. 세포 기반이나 in silico 모델로 독성 시험을 대체하는 것과, 임상적 유효성 주장을 대체하는 것은 법적으로 완전히 다른 차원의 문제입니다. 현재 후자를 뒷받침하는 규제 도구는 사실상 전무합니다.

둘째, 가장 직관적인 사실: 그 어떤 FDA나 EMA 규제 문서도 ‘디지털 트윈’, ‘가상 대조군’, ’가상 세포’라는 단어를 직접 명시하지 않으며, 이를 위한 전용 인허가 트랙을 신설하지 않았습니다. 가장 근접한 일반 프레임워크는 모델 파생 증거를 위한 ICH M15와 AI 파생 증거를 위한 2025년 1월 AI 신뢰성 평가 초안뿐입니다.

실무적 귀결은 가상 세포를 인허가 제출에 쓸 수 없다는 것이 아닙니다. 각 가상 세포 모델이 사용 맥락(context of use)에 따라 기존의 일반 모델 평가 기준에 맞춰 개별적으로 심사받아야 한다는 뜻입니다. “이것은 거대 파운데이션 모델입니다”라는 말은 규제 관점에서 아무런 증거력이 없으며, 활용할 수 있는 AI 전용 고속 승인 트랙 따위는 존재하지 않습니다.

가상 세포 기반 구축을 위한 6가지 실무 수칙

  1. 모델을 고르기 전에 베이스라인부터 확정하십시오. ‘변화 없음’ 예측기와 ‘단순 가산 합산’ 예측기가 모든 평가의 바닥 기준선입니다. 연구 결과가 이 두 가지를 모두 보고하지 않는다면, 제시된 수치는 해석이 불가능한 숫자입니다.
  2. 데이터 분할 방식을 명시적으로 보고하십시오. 무작위 분할은 모델을 과대평가합니다. 임베딩 공간에서 세포 상태 유사도에 기반한 미지의 세포 분할이 정직한 시험대입니다. 대부분의 화려한 성과는 후자 환경에서 급격히 축소됩니다.
  3. 단순 관측 데이터의 양보다 개입(중재) 데이터를 우선시하십시오. 이 분야에서 가장 강력한 실증적 발견은 교란 데이터로 사전학습된 단순 선형 모델이 모든 거대 파운데이션 모델을 이겼다는 사실입니다. 교란 데이터로 파인튜닝하십시오.
  4. 캘리브레이션을 부차적 진단이 아닌 핵심 인도물(deliverable)로 취급하십시오. 지표에 대한 학계의 논쟁은 아직 끝나지 않았습니다. 이 분쟁은 학문적 토론이 아니라 독립적인 복제 검증을 견뎌내는 평가 프로토콜에 의해 종결될 것입니다.
  5. 모든 주장에 데이터 출처 이력(provenance)을 명기하십시오. 동료 평가 완료, 동료 평가되었으나 단일 연구실, 프리프린트, 기업 자체 보고 등으로 라벨링하십시오. 화려한 응용 성과들은 대부분 뒤의 두 범주에 속해 있으며, 독립 코호트에서 검증된 유일한 사례는 공간 프로테오믹스 모델이었습니다.
  6. 과학적 주장을 펼치기 전에 규제상의 주장 범위를 확정하십시오. 모델이 지원하는 의사결정이 안전성 결정인지(규제 프레임워크 존재), 유효성 주장인지(구체적 가이드라인 부재)를 명확히 파악하고, 2025년 1월 프레임워크의 요구에 맞춰 사용 맥락별로 밸리데이션하십시오.

결론 (The Bottom Line)

AI 가상 세포는 실질적으로 작동하는 정교한 표현 계층(Representation Layer)과 막대한 자본이 뒷받침된 데이터 인프라를 확보했습니다. 그러나 상태 간의 인과적 변화를 예측하는 전이 계층(Transition Layer)은 아직 입증되지 않았습니다. 분야 스스로도 이를 잘 알고 있습니다. 자체 벤치마크가 이를 말해주고 있고, 대회 주최자가 이를 인정했으며, 가장 중요한 논문이 부정적 결과를 제목으로 내걸고 있습니다.

반론 역시 타당하며 논쟁은 현재진행형이지만, 그 반론이 인정하고 있는 전제에 주목하십시오. 바로 이견의 본질이 역량이 아니라 **측정 방식(measurement)**에 관한 것이라는 점입니다. 이것이 기술의 진정한 현주소입니다. “AI가 세포를 완벽히 시뮬레이션한다”가 아니라, “AI가 세포를 시뮬레이션하고 있는지를 어떻게 점수 매겨야 할지 아직도 합의에 이르지 못했다”가 진실입니다.

2026년 가상 세포 챌린지는 교란된 적 없는 6개 세포주를 대상으로 제로샷 평가를 진행하며, 11월에 그 결과가 공개됩니다. 주시해야 할 진짜 숫자는 바로 그것입니다. 그 결과가 나오기 전까지 마케팅되는 모든 주장은 가설 생성기로 소비되어야 합니다.


관련 기사: 117개 AI 개발 신약 파이프라인, 승인은 0건 · 일반화의 벽: 저분자 화합물과 바이오로직스에서 분자 AI가 실제로 전달하는 가치 · 환각 엣지 없는 지식 그래프 구축

출처 및 참고 문헌: Ahlmann-Eltze, Huber & Anders, “Deep-learning-based gene perturbation effect prediction does not yet outperform simple linear baselines,” Nature Methods 22:1657–1661 (2025) · Kedzierska et al., Genome Biology 26:101 (2025) · Miller et al., Nature Biotechnology (2026년 10월) · Mao et al., arXiv:2604.27646 · Wei et al., Nature Methods (2026) · Bunne et al., Cell 187(25):7045–7063 · Xing & Song, Cell 189(19):5831–5844 · Theodoris et al., Nature (2023) · Cui et al., Nature Methods (2024) · Hao et al., Nature Methods (2024) · Rosen et al., Nature 656:183–191 · TranscriptFormer, Science · STATE, Cell (2026) · CellVQ, Nature Communications 17:4037 · AlphaGenome, Nature (2026) · C2S-Scale (Google Research; bioRxiv 2025) · X-Cell (Xaira) · Arc Institute Virtual Cell Challenge 2025 및 2026 발표자료 · Arc Virtual Cell Atlas · scBaseCount · Tahoe-100M, Cell 189(19):5945–5961 · Evo2, Nature 652:1349–1361 · Chan Zuckerberg Initiative Virtual Cells Platform, cz-benchmarks, rBio · UNAGI, Nature Biomedical Engineering (2025) · ProteinTalks, Nature (2026년 9월) · CAPTAIN, Nature Communications (2026) · VirTues, Nature (2026) · 전장 형태학 아틀라스, Nature Methods (2025) · FDA 현대화법 2.0 (FDMA 2.0, Pub. L. 117-328 §3209) · FDA NAMs 가이드라인 초안 (91 FR 13313) · FDA 비임상 시험 용어 직접 최종 규칙 (91 FR 59988) · FDA AI 신뢰성 가이드라인 초안 (Docket FDA-2024-D-4689) · ICH M15 (91 FR 33179) · FDA/EMA 우수 AI 실무 원칙 (2026년 1월 14일).

연구 노트: [[AI-Virtual-Cells-Cellular-Representation-2026]]