지난 18개월간 발표된 네 가지 주요 연구 결과는 서로 다른 방향에서 동일한 하나의 ’벽’을 가리키고 있습니다.
PoseBusters는 딥러닝 기반 분자 도킹(docking)이 2 Å RMSD 이내의 구조를 예측하더라도 그것이 물리적으로 불가능한 포즈인 경우가 빈번함을 입증했습니다. Astex 벤치마크에서 TankBind는 리간드의 59%를 2 Å 오차 범위 내에 배치했으나, 기본 물리적 타당성 검사를 통과한 비율은 5.9%에 불과했습니다. GenBench3D는 표준 3D 생성 모델 전반에서 유효한 입체 형태(conformation)를 생성한 분자가 겨우 **0~11%**에 그쳤음을 밝혀냈습니다. 150개 이상의 모델-작업 조합을 평가한 벤치마크인 BOOM은 단 하나의 모델도 작업 전반에 걸쳐 강력하게 일반화되지 못했음을 확인했습니다. 심지어 최고 성능의 모델조차 분포 외(OOD, Out-of-Distribution) 데이터에서 분포 내(In-Distribution)보다 평균 3배 높은 오차를 기록했습니다. 마지막으로 학습 데이터 컷오프 이후에 공개된 2,600개 시스템을 대상으로 공동 접힘(co-folding) 모델들을 평가한 Runs N’ Poses는, 이 모델들이 새로운 결합을 물리적으로 이해하는 것이 아니라 과거에 본 리간드 포즈를 대거 **단순 암기(memorize)**하고 있다는 결론을 내렸습니다.
이것이 모델의 무용성을 뜻하지는 않습니다. 모델들이 **보간(interpolation, 알려진 데이터 범위 내 추정)**을 수행하고 있음을 의미합니다. 그러나 신약 개발의 본질은 아직 존재하지 않는 미지의 영역을 탐색하는 작업입니다.
재현 가능한 실제 성과와 마케팅용 수사학을 엄격히 분리하여 분자 설계 AI 스택의 현주소를 정리합니다.
두 모달리티가 수렴한 공통 아키텍처 스택
저분자 화합물(Small molecules)과 바이오로직스(Biologics)는 서로 다른 학문 분야에서 출발했으나, 이제 단 하나의 통합 아키텍처로 수렴했습니다: 파운데이션 모델 → 조건부 생성 → 물성 예측 → 다목적 순위화 → 실험실 선별 → 재학습. 대상 객체만 다를 뿐, 순환 루프는 완전히 동일합니다.
표적 (TARGET)
│
▼
구조 / 공동 접힘(co-folding) 모델
(AlphaFold 3, Boltz, Chai)
│
▼
결합 부위 또는 에피토프
│
▼
┌─ 생성기 (GENERATOR) ──────────────────────────┐
│ 저분자: 디퓨전(diffusion), 트랜스포머 │
│ 바이오로직스: 백본 디퓨전, 단백질 언어 모델 │
└───────────────────────┬───────────────────────┘
│ 10^4 ~ 10^6 후보군
▼
┌─ 예측기 (PREDICTORS) ─────────────────────────┐
│ 역가 · ADMET · 결합 친화도 · 개발 가능성 │
└───────────────────────┬───────────────────────┘
│ 순위화 + 불확실성 산출
▼
┌─ 품질 관문 (GATES) ───────────────────────────┐
│ 3D 유효성 · 입체화학 (stereochemistry) │
│ 역합성 경로 분석 (AiZynthFinder 등) │
└───────────────────────┬───────────────────────┘
▼
10~100개 최종 화합물
│
▼
웻 랩 (WET LAB)
│
▼
독점 실험 데이터 ──► 모델 재학습
여기서 마지막 화살표만이 기업의 독점적 가치를 축적(compound)시킵니다. 그 위의 모든 단계는 점차 표준 범용재(commodity)가 되어가고 있습니다.
| 항목 | 저분자 화합물 (Small Molecules) | 바이오로직스 (Biologics) |
|---|---|---|
| 표현 방식 | 분자 그래프, SMILES/SELFIES, 3D 포인트 클라우드 | 아미노산 서열, SE(3) 공간의 백본 프레임 |
| 탐색 공간 | 약 10⁶⁰개의 약물 유사 구조 | 20^L의 아미노산 서열 공간 |
| 생성 엔진 | 디퓨전, 자기회귀 트랜스포머, 강화학습(RL) | 백본 디퓨전 + 역접힘(inverse folding), pLM |
| 설계 단계 | 단백질 포켓 내 원자 배치 / 단편(fragment) 조립 | 백본 구조 생성 → 최적 서열 설계 |
| 탈락 관문 | 합성 가능성(Synthesizability), ADMET | 개발 가능성(Developability): 응집, 점도, 면역원성 |
| 분야 성숙도 | 방법론적으로 성숙, 화학 합성 단계가 병목 | 최신 기술, 높은 랩 적중률, 취약한 독립 검증 |
혼동되고 있는 세 가지 검증 도구
이 영역은 학술 논문이나 기술 분석에서도 가장 빈번하게 왜곡되는 부분입니다.
모델은 화학적으로는 불가능하지만 기하학적으로는 그럴듯해 보이는 포즈를 쉽게 만들어냅니다. 다음 세 가지 독립된 도구는 서로 완전히 다른 결함 모드를 측정하지만 현장에서는 상호 호환되는 것처럼 인용되곤 합니다:
| 도구 | 실제 측정 대상 | 대표적 연구 결과 |
|---|---|---|
| PoseBusters | 예측된 **포즈(pose)**의 물리적 타당성: 결합 길이, 각도, 평면성, 입체 충돌, 부피 중첩 | 딥러닝 도킹이 2 Å RMSD 미만의 오차를 달성하더라도 해당 포즈는 물리적으로 불가능한 경우가 많음 |
| GenBench3D | 생성된 분자 자체의 3D 유효성(Validity3D): CSD 기반 결합/각도 확률, 분자 내 입체 충돌 | 생성된 분자 중 유효한 3D 입체 형태를 지닌 비율은 0~11%에 불과함 |
| PoseCheck | 분자 간 단백질-리간드 충돌 및 포켓 부피 중첩 | 분자 자체의 내부 기하학이 아닌, 표적 단백질과의 입체적 충돌 측정 |
여기서 두 가지 사실을 바로잡아야 합니다. 첫째, 널리 회자되는 “최대 95%의 비정상적 포즈”는 PoseBusters의 측정치가 아닙니다. GenBench3D 논문에서 LiGAN 및 3D-SBDD의 선행 연구 결과를 요약한 수치입니다. 둘째, “3D 생성기가 PoseBusters 검사를 통과하지 못하는 주원인은 단백질 포켓과의 충돌 때문”이라는 통념 역시 사실과 다릅니다. GenBench3D에서 나타난 주된 실패 원인은 단백질과의 접촉이 아니라 비현실적인 결합 길이와 결합 각도였습니다. 분자 간 충돌을 측정하는 도구는 PoseCheck입니다.
이러한 구분은 단순한 말꼬리 잡기가 아닙니다. 결함의 원인이 분자 내부 기하학에 있다면 솔루션은 원자가(valence)를 인식하는 디코더를 구축하는 것입니다. 반면 단백질 포켓과의 충돌이 문제라면 충돌 회피 가이던스를 도입해야 합니다. 엉뚱한 결함을 고치느라 분기를 낭비해서는 안 됩니다.
관문 2: 합성 가능성 (Synthesizability)
분자 생성은 쉬운 절반에 불과합니다. 합리적인 단계 내에서 실제로 합성해낼 수 없다면 생성된 분자는 아무런 가치가 없습니다.
업계는 생성 이후에 합성 가능성을 필터링하던 방식에서, 생성 과정 도중에 합성 제약을 직접 인코딩하는 방향으로 진화했습니다:
- RxnMol은 분자 구조를 직접 다루지 않고 합성 경로 자체를 생성 단위로 삼습니다. 즉 분자가 곧 경로입니다.
- SynFormer (PNAS 2025)는 “설계된 분자가 합성적으로 다루기 용이함을 보장하기 위해” 합성 경로를 설계 객체로 직접 생성합니다.
- SynFlowNet을 AiZynthFinder와 결합했을 때 3단계 역합성 경로는 62%, 4단계 경로는 **40%**의 성공률을 기록했습니다. 유사한 반응 기반 생성기들의 성공률도 경로 길이와 검증 도구에 따라 53~87% 범위에 머물렀습니다.
이 수치들이 말해주는 진실은 명확합니다. 반응을 고려하여 생성하더라도 외부의 독립적인 역합성 분석 엔진으로 검증하면 전체 산출물의 3분의 1에서 절반이 여전히 합성 불가능으로 탈락합니다. 모델 내부의 유효성은 현실 세계의 유효성이 아닙니다.
스크리닝 측면의 성과도 주목할 만합니다. Rosetta 도킹 공간에 대한 진화적 탐색 알고리즘인 REvoLd는 5개 표적에 대해 무작위 선별 대비 869배에서 1,622배 향상된 히트 적중률을 보고했습니다. 이는 생성 모델이 평범하더라도 머신러닝 기반의 선별(selection) 프로세스만으로 대부분의 가치를 포착할 수 있음을 입증한 강력한 실증 연구입니다. 슈뢰딩거 역시 능동 학습(active learning) 워크플로우를 통해 0.1%의 비용으로 최고 점수 화합물의 약 70%를 회수할 수 있다는 유사한 결과를 홍보하고 있습니다. 10억 개의 화합물을 전수 Glide로 도킹할 때 17,361 컴퓨팅 일수와 125만 달러가 소요되던 것을 능동 학습을 적용해 37일과 2,041달러로 단축했다는 주장입니다. 비록 이는 동료 평가를 거친 논문이 아닌 벤더의 마케팅 수치이지만, 오픈 문헌의 흐름과 일치하며 중요한 전략적 함의를 던집니다: 서로게이트 모델이 1,000분의 1 비용으로 좋은 분자의 70%를 찾아낼 수 있다면, 생성 모델의 품질 자체는 더 이상 결정적인 차별화 요소가 되지 못합니다.
물성 예측: 신뢰할 수 있지만 리더보드의 왜곡이 가장 심한 영역
물성 예측(Property prediction)은 머신러닝이 신약 탐색에 기여하는 가장 화려하지 않으면서도 가장 신뢰할 수 있는 영역입니다. 동시에 벤치마크 리더보드의 주장을 가장 엄격하게 따져보아야 할 곳이기도 합니다.
실제로 검증된 사실:
- 2025년 ASAP-Polaris-OpenADMET 맹검 챌린지 결과: “역가(potency) 예측에서는 고전적 방법들이 여전히 높은 경쟁력을 유지했으나, ADME 예측에서는 최신 딥러닝 알고리즘이 전통적인 머신러닝을 유의미하게 압도했습니다.” 이는 딥러닝이 역가가 아니라 ADME 예측에서 확실한 가치를 발휘한다는 명확한 사실을 보여줍니다.
- 62,820개의 모델을 학습시켜 비교한 대규모 연구에 따르면, **RDKit2D 기술자(descriptor) 기반의 랜덤 포레스트(Random Forest)**가 BACE, BBBP, ESOL, Lipophilicity 데이터셋에서 MolBERT와 GROVER 같은 거대 딥러닝 모델들을 p < 0.05 수준에서 능가했습니다.
- 단 하나의 원자 변화로 IC₅₀가 1,000배 이상 요동치는 활성 절벽(Activity cliffs) 현상은 일반적 수준에서 여전히 미해결 상태이며, 이 영역에서는 분자 기술자 기반 방법이 딥러닝보다 뛰어납니다.
신뢰하기 어려운 영역:
- BACE 데이터셋의 71%는 최소 하나 이상의 입체 중심(stereocenter)이 정의되지 않은 분자들입니다. MoleculeNet에서 가장 빈번하게 인용되는 ADMET 벤치마크 데이터셋이 정작 자체 데이터의 대다수에 대해 거울상이성질체를 구별하지 못하고 있습니다.
- 공개 ADMET 데이터는 일관되지 않은 SMILES 표기, 중복 데이터, 모순된 라벨로 가득 차 있습니다. BACE 데이터셋은 55개의 서로 다른 분석 논문에서 수집되었으며, 데이터 통합 과정에서 발생한 노이즈가 실제 신호보다 클 수 있습니다.
- TDC(Therapeutics Data Commons) ADMET 리더보드는 철저한 감사를 견뎌내지 못합니다. 1위 모델인 Chemprop-RDKit은 순수 딥러닝이 아니라 D-MPNN에 RDKit 화학 특성을 결합한 하이브리드 모델입니다. 게다가 2026년 감사 결과 상위 10개 모델 중 재현 가능한 모델은 단 3개에 불과했습니다. 하나는 데이터 누수가 있었고, 두 개는 TDC 테스트 세트의 분자가 포함된 분할에서 평가되었습니다. Chemprop-RDKit이 유효하게 1위를 유지하는 영역은 용해도(solubility)뿐입니다.
실무적 시사점: 물성 모델은 동일한 화학 계열(chemical series) 내에서 순위를 매기는 도구이지, 이질적인 화학형(chemotypes) 간의 물성을 정량적으로 예측하는 도구가 아닙니다. 생성 모델이 다중 파라미터 프로파일을 자율적으로 최적화하도록 무작정 맡겨두어서는 안 되는 이유가 바로 여기에 있습니다.
공동 접힘(Co-folding): 주장과 증거 사이의 가장 큰 간극
구조 및 결합 친화도 예측은 이 분야에서 가장 빠르게 발전하며 가장 공격적으로 마케팅되는 영역입니다. 재현성 대조표를 가장 정밀하게 살펴봐야 할 지점입니다.
| 주장 내용 | 상태 | 상세 확인 결과 |
|---|---|---|
| Boltz-2 오픈소스 공개 (MIT 라이선스 / Recursion) | 검증 완료 | 공개 저장소 및 모델 가중치 확인 |
| Boltz-2 CASP16 친화도 예측 1위, r = 0.65 | 기업 자체 보고 | 저자들의 사후적(retrospective) 자체 분석 결과임. Boltz-2는 CASP16의 공식 참가 모델이 아니었음. 독립적인 재현 실험에서는 약 0.52 기록 |
| Boltz-2가 1,000배 빠른 속도로 FEP 수준 정확도에 근접 | 기업 자체 보고 | 연산 속도 단축은 사실이나, 정확도 동등성은 자체 선별된 벤치마크에 국한됨 |
| Boltz-2 + 생성 모델로 TYK2 바인더 발굴 | 검증 완료 | 웻 랩이 아닌 절대 FEP 시뮬레이션을 통해 확인됨. 이후 에이전트 기반 웻 랩 시도에서 23개 중 3개 활성 물질 확인 (IC₅₀ 약 240 nM) |
| Boltz-2.1은 폐쇄형이며 API 전용임 | 거짓 (False) | Boltz-2 계열은 오픈소스로 유지됨 (v2.1.0 → v2.2.1, 2026년 9월). 새로운 BoltzMol-1 및 BoltzProt-1만 API 전용임 |
| 공동 접힘 모델들은 주로 리간드 포즈를 암기함 | 검증 완료 | 컷오프 이후 2,600개 시스템 분석 결과, 모델은 과거 보았던 리간드 구조를 그대로 배치함 |
| 결합 부위가 변이되어도 ATP를 원래 위치에 유지함 | 검증 완료 | 깔때기 메타다이내믹스(funnel metadynamics) 시뮬레이션으로 독립적 검증 완료 |
| 미지의 새로운 포켓에서는 물리 기반 도킹이 공동 접힘을 능가함 | 검증 완료 | 신규 리간드 및 포켓에 대해 Attracting Cavities와 AutoDock Vina가 공동 접힘 모델보다 우수함 |
| 단순 프래그먼트조차 기본적으로 오르토스테릭 부위로 수렴함 | 검증 완료 | 알로스테릭 및 은닉 포켓은 구조적인 취약점으로 잔존 |
| IsoDDE가 가장 어려운 신규 시스템에서 AlphaFold 3 대비 2배 이상의 성능을 냄 | 기업 자체 보고 | 2026년 2월 기술 보고서, 코드 및 가중치 미공개. 물리 기반 FEP+와 OpenFE를 능가한다고 주장하나 검증 불가 |
솔직한 총평: 제로샷(zero-shot) 공동 접힘 모델은 의사결정 도구가 아니라 가설 생성기입니다. 실무에서 검증된 표준 패턴은 사전학습된 친화도 헤드를 맹신하는 것이 아니라 프로젝트 고유 데이터로 파인튜닝하여 사용하는 것입니다.
바이오로직스: 더 높은 적중률, 더 취약한 독립 검증
단백질 언어 모델(pLM)은 핵심 기술 계층입니다. IgLM은 5억 5,800만 개의 항체 중쇄/경쇄 가변 서열로 학습되었고, BALM은 3억 3,600만 개의 서열로 학습되었습니다. AlphaFold 3는 단백질, 핵산, 리간드, 이온 복합체로 구조 예측을 확장했으며 항체-표적 결합을 명시적으로 모델링합니다.
그 위에 데 노보(de novo) 설계 기술이 자리 잡고 있으며, 여기서 성과는 ’누구나 재현할 수 있는 결과’와 ’기업이 일방적으로 발표한 결과’로 극명히 갈립니다.
재현 가능한 성과:
- RFdiffusion (Nature 2023): IL-7Rα, InsR, PD-L1, TrkA 표적에 대해 기존 방법 대비 “약 2차수(orders of magnitude) 높은” 성공률 달성. 설계된 인플루엔자 헤마글루티닌 바인더는 cryo-EM으로 확인되었으며 계산 모델과 0.63 Å RMSD로 일치함. (이는 모델 일치도 수치이며 전자현미경 맵 자체의 해상도는 2.9 Å이었음.)
- BindCraft (Nature 2025): 표적 전반에서 **10~100%**의 성공률 보고. 단, 외부 비판에 따르면 보고된 212개 설계 중 바인더 65개 중 Kd가 측정된 것은 20개에 불과함.
- RFdiffusion3 (오픈 프리프린트): 원자 수준 설계 지원, RFdiffusion2 대비 약 10배 가속. 스크리닝된 190개 효소 설계 중 35개가 다중 턴오버 활성을 보임 (최고 kcat/Km = 3557 M⁻¹s⁻¹).
- BoltzGen (오픈소스 MIT 라이선스): 9개 신규 표적에 대해 표적당 15개 설계 시 66%(6/9)에서 나노몰(nM) 수준 바인더 확보.
기업 일방 발표 성과:
| 결과 | 주의해야 할 한계 |
|---|---|
| Chai-2: 52개 표적에 대해 표적당 20개 이하 설계로 16% 히트율; 미니단백질 68% 성공; 전체 길이 mAb의 86% 이상이 치료제 수준의 개발 가능성을 가짐 | 폐쇄형 모델, 자체 기술 보고서. 독립 검토 결과 생존 편향(survivor bias) 발견: 발현 또는 순도 검사에서 탈락한 IgG 88개 중 7개, VHH-Fc 27개 중 10개가 개발 가능성 통계 산출 이전에 데이터에서 제외됨 |
| Latent-X2: 18개 표적 중 9개에서 바인더 확보; 인간 공여자 패널에서 “최초로” 낮은 면역원성 확인 | 단일 표적에서 나온 4개의 VHH-Fc 융합 단백질에 불과하며, HLA-B44에 60% 편향된 10명의 공여자 패널에서 양성 대조군 없이 시험됨 |
| AlphaProteo: 3~300배 친화도 개선, 서브나노몰 바인더 | 폐쇄형 기술 보고서; 독립적 재현 불가 |
| Schrödinger 능동 학습: 0.1% 비용으로 70% 히트 포착 | 벤더 마케팅 페이지, 동료 평가 논문 아님 |
누군가 거짓말을 하고 있다는 뜻이 아닙니다. 가장 화려한 수치는 폐쇄형 플랫폼에서 나오며, 외부 연구자가 이를 재계산하는 순간 분모(denominator)가 바뀐다는 점이 핵심입니다.
이 섹션의 전략적 결론으로 반드시 기억해야 할 동료 평가 연구가 있습니다. **바이오젠(Biogen)**은 33개의 과거 치료제 개발 프로그램에서 나온 내부 항체 데이터를 바탕으로 단백질 언어 모델을 평가했습니다. 그 결과, 사전학습된 표현만 사용하는 것보다 내부 서열 데이터를 활용한 도메인 적응형 파인튜닝(domain-adaptive fine-tuning)이 개발 가능성 예측 정확도를 일관되게 향상시켰습니다. 파운데이션 모델은 범용재입니다. 33개 프로그램의 독점 데이터는 결코 범용재가 아닙니다.
환자 체내에서 실제로 분자들이 보여준 결과
- 렌토세르팁 (Rentosertib, Insilico Medicine, TNIK 억제제, 특발성 폐섬유증 IPF). 임상 2a상 결과 위약군 평균 FVC 변화는 −20.3 mL (95% CI −116.1 ~ 75.6)였던 반면, 60 mg QD 투여군은 +98.4 mL (95% CI 10.9 ~ 185.9)였습니다. 널리 유포된 위약군 −62.3 mL 수치는 2024년 11월 인실리코의 보도자료 수치이며 최종 논문에는 수록되지 않았습니다. 간 손상 또는 간 기능 장애로 7명이 투약을 중단했으며, 그중 4명은 닌테다닙(nintedanib)을 병용 투여 중이었습니다. 3상(320명 대상, 47개 기관, 52주)은 2026년 9월 9일 첫 환자 투약을 개시했습니다.
- 자소시티닙 (Zasocitinib, TAK-279, Takeda). 3상에서 듀크라바시티닙(deucravacitinib)과의 직접 비교(head-to-head)에서 우위를 입증하고 2026년 9월 우선심사 NDA 승인을 획득했습니다 (PDUFA 2027년 1분기). 님버스는 13,000개 이상의 화합물을 계산적으로 평가하는 과정에서 머신러닝과 자유에너지 섭동(FEP)을 활용했습니다. 그러나 “최초의 AI 승인 신약”이라는 프레임은 개발 당사자들에 의해 부정되고 있습니다. 님버스의 R&D 총괄은 이 화합물이 2020년에 이미 도출되었음을 밝히며 AI 신약이라는 라벨링을 거부했습니다.
- GB-0895 (Generate:Biomedicines). 항 TSLP 항체로 2개의 3상 시험(총 약 1,600명 환자, 6개월 1회 투약)을 진행 중이며, 2상 유효성 시험을 거치지 않고 곧바로 3상에 직행했습니다. Generate 측의 공식 표현은 “AI로 엔지니어링됨(engineered with AI)“이므로 엄밀한 데 노보 설계라 보기는 어려울 수 있으나, “후기 임상에 진입한 AI 설계 항체는 없다”는 명제가 더 이상 사실이 아님을 증명합니다.
- **리커전(Recursion)**은 엑센시아 합병 이후 REC-2282, REC-994, REC-3964의 개발을 중단하거나 후순위로 미뤘으며, 2025년 5월 REC-4539를 일시 정지하고 전임상 파이프라인 하나를 정리했습니다.
- 파이프라인 통계: 63개 기업에서 117개의 AI 기반 자산이 임상에 진입했습니다. 명시적 방법론을 갖춘 동료 평가 기준이며, 60개가 1상을, 8개가 2상을 마쳤고 82%가 저분자 화합물입니다. 시중에 떠도는 “75개 이상”은 낡은 2024년 기준 하한선이며, “200개 이상”은 검증 가능한 방법론을 공개하지 않은 수치입니다. 현재까지 FDA 승인을 획득한 AI 발굴 신약은 0건입니다.
실무 추진을 위한 6대 원칙
- 수치를 비교하기 전에 도구의 출처를 먼저 분류하십시오. 동료 평가 오픈소스, 오픈 프리프린트, 폐쇄형 기술 보고서로 분류하십시오. 이 분류 체계가 벤치마크 표보다 실제 재현 결과를 훨씬 정확하게 예측합니다.
- 평가 지표보다 데이터 분할(split) 방식을 먼저 감사하십시오. 무작위 분할이 아니라 시계열 기반 분할과 골격(scaffold) 기반 분할이어야 합니다. 논문이 단 하나의 분할 결과만 제시한다면 그 수치를 성능의 최댓값(상한선)으로 간주하십시오.
- 내부 유효성과 외부 유효성을 분리하십시오. 모델 내부의 합성 가능성 검사, 자체 신뢰도 점수, 자체 친화도 헤드는 모두 스스로를 과대평가합니다. AiZynthFinder를 돌리고, PoseCheck를 실행하며, 기본 도킹 베이스라인과 대조하십시오.
- 가장 중요한 예측 헤드는 직접 파인튜닝하십시오. 사전학습된 모델은 출발점일 뿐이며, 프로젝트 고유 데이터가 진정한 제품입니다. 바이오젠의 항체 연구가 보여준 방식이 모범 사례입니다.
- 생성뿐만 아니라 실험적 선별 과정을 시스템화하십시오. 모델이 10⁶개의 후보를 제안하고 실험실이 10²개를 분석할 수 있다면, 실제 가치는 전적으로 순위화 알고리즘과 불확실성 추정에 달려 있습니다.
- 측정값과 함께 풍부한 메타데이터를 기록하십시오. 화합물 구조와 IC₅₀ 값만 저장하는 것은 취약한 학습 데이터에 불과합니다. 화합물, 표적 단백질, 구조체, 분석법, 세포주, 프로토콜, 분석 장비, 배치, 반복 횟수, 원시 측정값, 불확실성까지 모두 기록해야 비로소 실험실이 자가 학습 시스템으로 전환됩니다.
결론 (The Bottom Line)
분자 AI의 아키텍처는 수렴을 마쳤으며 생성 계층의 역량은 분명 실재합니다. 디퓨전 모델은 포켓 안에서 분자를 설계하고, 단백질 언어 모델과 백본 디퓨전은 자연 진화가 시도하지 않은 결합체를 창조하며, 반응 기반 생성 기술은 합성 가능성의 간극을 좁히고 있습니다. 그러나 이 분야가 아직 해결하지 못했고 모든 독립 검증이 거듭 확인하는 한계는 바로 **학습 분포를 벗어난 미지 영역으로의 일반화(generalization beyond the training distribution)**입니다. 그리고 신약 탐색은 바로 그 미지 영역에서 이루어집니다.
따라서 단기적으로 가장 신뢰할 수 있는 레버리지는 더 큰 생성 모델을 도입하는 데 있지 않습니다. 엄격한 품질 관문, 평가의 규율, 불확실성 추정 메커니즘, 그리고 다음번 파인튜닝을 이전보다 더 강력하게 만들어줄 독점적인 실험 데이터 인프라를 구축하는 데 있습니다.
관련 기사: 117개 AI 개발 신약 파이프라인, 승인은 0건 · 환각 엣지 없는 지식 그래프 구축 · 결정 레이어: 밸리데이션된 쓰기 경로 외부의 타입 안전 모델
출처 및 참고 문헌: PoseBusters, Chem. Sci. 2024 · GenBench3D (arXiv:2407.04424) · PoseCheck (arXiv:2308.07413) · DiffDock (ICLR 2023) · TargetDiff (ICLR 2023) · Pocket2Mol (ICML 2022) · DiffSBDD, Nat. Comput. Sci. 2024 · RxnMol (github.com/snu-lcbc/RxnMol) · SynFormer, PNAS 2025 · SynFlowNet · RGFN · REvoLd, Commun. Chem. 2025 · Fischer et al., JCIM 2025 · Deng et al., Nat. Commun. 14:6395 · BOOM, NeurIPS D&B 2025 · van Tilborg et al., JCIM 2022 · Li et al. (arXiv:2604.16586) · Koleiev et al. (bioRxiv 2026) · Boltz-2 (github.com/jwohlwend/boltz) · Runs N’ Poses, Nat. Struct. Mol. Biol. 2026 · Masters, Mahmoud & Lill, Nat. Commun. 16:8854 · Attracting Cavities (bioRxiv 2025) · CAFE (PubMed 42539081) · Isomorphic Labs IsoDDE 기술 보고서 (2026년 2월 10일) · RFdiffusion, Nature 2023 · BindCraft, Nature 2025 · RFdiffusion3 (2025년 12월) · BoltzGen (bioRxiv 2025) · AbDiffuser, NeurIPS 2023 · IgLM, Cell Systems 2023 · BALM, Brief. Bioinformatics 2024 · Biogen 항체 pLM 연구, mAbs 2026 · Chai-2 기술 보고서 · Latent-X2 (arXiv:2512.20263) · 렌토세르팁 2a상, Nature Medicine · 다케다 자소시티닙 발표자료 · Generate:Biomedicines GB-0895 임상 3상 · Schrödinger 능동 학습 백서.
연구 노트: [[AI-in-Early-Drug-Discovery-Molecular-ML-2026]]
Saram Consulting