AGENTIC AI · SSTR2 RADIOPHARMACEUTICAL DISCOVERY
SSTR2 선택성 펩타이드 발굴 시스템
기술 보고서
SST-14(AGCKNFFWKTFTSC) 변이체를 PyRosetta 실측 도킹 + LLM 에이전트 루프 + 무한 발굴 엔진으로 스크리닝하여 SSTR2 선택적(SSTR1/3/4/5 회피) 방사성의약품 후보를 발굴한다. 아래 모든 기능 설명은 코드 file:line 인용으로 검증되었으며, 미검증 항목은 명시한다.
110
무한 엔진 epoch (가동 중)
+10.5351
역대 best Δmargin (native +13.37 초과분)
48/50
엄격기준 충족 (Δ>0 & ΔG≤−15 & 비독성)
645
누적 스크리닝 고유 서열
🎯 현재 성과 (in-silico, 라이브 리더보드 직독):
무한 엔진이 110 epoch 누적 → 최상위 후보
정직성 단서: 모두 in-silico proxy이며 wet-lab 미검증이다. 절대 ΔG·HC50 단위는 미보정이고, home-advantage(curated SSTR2가 source 복합체 유래) 보정 후 상대 우위로만 해석해야 한다.
AGCKNFFWKTDTSC
(Δmargin +10.5351, margin 23.9051, ΔG -45.1112,
독성 native 이하). 2026-06-10 선택성 GOAL 성공기준(≥3건)을 48건으로 대폭 초과.
정직성 단서: 모두 in-silico proxy이며 wet-lab 미검증이다. 절대 ΔG·HC50 단위는 미보정이고, home-advantage(curated SSTR2가 source 복합체 유래) 보정 후 상대 우위로만 해석해야 한다.
시스템 아키텍처
flowchart TD
IN["입력: SST-14 복합체 PDB
AGCKNFFWKTFTSC"] --> LLM["LLM 레이어
vLLM Qwen3-32B
Planner·Critic·Reporter"] LLM --> MUT["변이 엔진
scaffold 가드(SS·FWKT)"] MUT --> DOCK["PyRosetta FlexPepDock
실측 ΔG"] DOCK --> SEL["in-loop 선택성
off-target 5종 → Δmargin"] DOCK --> SCORE["다목적 스코어링
ΔG·반감기·Δmargin·ADMET"] SEL --> SCORE SCORE --> RANK["NSGA-II Pareto + scalar"] RANK --> LB["글로벌 선택성 리더보드
(영속·warm-start)"] LB --> ENG["무한 발굴 엔진
epoch 무한·다양성 탈출"] ENG --> MUT ENG -.6h autopush.-> GH["GitHub (외부 모니터링)"] ENG -.미연결.-> UI["웹 UI(FastAPI+React+Mol*)"]
AGCKNFFWKTFTSC"] --> LLM["LLM 레이어
vLLM Qwen3-32B
Planner·Critic·Reporter"] LLM --> MUT["변이 엔진
scaffold 가드(SS·FWKT)"] MUT --> DOCK["PyRosetta FlexPepDock
실측 ΔG"] DOCK --> SEL["in-loop 선택성
off-target 5종 → Δmargin"] DOCK --> SCORE["다목적 스코어링
ΔG·반감기·Δmargin·ADMET"] SEL --> SCORE SCORE --> RANK["NSGA-II Pareto + scalar"] RANK --> LB["글로벌 선택성 리더보드
(영속·warm-start)"] LB --> ENG["무한 발굴 엔진
epoch 무한·다양성 탈출"] ENG --> MUT ENG -.6h autopush.-> GH["GitHub (외부 모니터링)"] ENG -.미연결.-> UI["웹 UI(FastAPI+React+Mol*)"]
"간접 검증"은 무엇이고 왜 신뢰할 수 있나
절대 실측(wet-lab)이 없는 지표는 상대 순위·상관 검증으로 의사결정 신뢰를 확보한다. 핵심 사례:
- 혈중 반감기: 절대 t½ 캘리브레이션은 없지만, 문헌 t½ 공개 펩타이드 대비 Spearman ρ≥0.86(휴리스틱)/0.78(RF CV)로 "어느 후보가 더 오래 가나"라는 순위 경향성을 검증(test_halflife_benchmark.py).
- 독성: pepADMET binary는 비변별적(옥시토신·native 모두 toxic)이라 폐기 → HC50을 native 대비 상대값으로 게이트(절대 단위 미검증).
- 선택성: curated SSTR2가 source 유래라 native 자체 margin +13.37 → Δmargin = margin − 13.37(home-advantage 보정)로만 진짜 우위 판정.
- ΔG: PyRosetta 실측이나 절대값 calibration은 없음 → 후보 간 상대 비교로 사용, 실패는 fail-closed(999) 도태.
🧪 벤치마크 검증 — 방법론 & 결과
방법론(공통): 온라인 공개 문헌의 실측 ground-truth(펩타이드 t½·용혈 HC50, 전부 출처 URL 인용)를
모으고, 동일 서열에 우리 파이프라인 예측을 실제 코드로 실행한 뒤 둘의 순위·분류 일치도를 정량화한다
(Spearman ρ = 순위상관, ROC-AUC = 용혈/비용혈 분류력, Pearson r = 물성 계산 일치). 절대 캘리브레이션이 없는 surrogate를
"상대 순위가 맞는가"로 정직하게 평가하는 설계다. 우리 예측값은 재현 가능(`bench_run.py`/`bench_admet_tox.py`).
① 혈중 반감기 (t½) · N=32
문헌 실측 t½ 순위 vs 우리 예측 순위 (Spearman). L-aa(23) vs D-aa(9) 분리.
| 그룹 | raw ρ | +metadata ρ |
|---|---|---|
| 전체 | +0.40 | +0.66 |
| L-aa | +0.13 | +0.34 |
| D-aa | +0.44* | +0.28* |
결과: L-aa는 정보 없이도 방향성 추종(raw +0.13).
D-aa는 raw가 전부 ~0.04h로 바닥(역전) → 변형 메타데이터를 주면 자릿수 교정, 전체 ρ +0.40→+0.66.
한계는 "공식 부재"가 아니라 메타데이터 부재. (*그룹 ρ는 소표본 노이즈)
L 유효 / D는 메타데이터 필요자세히 →
② ADMET (물성 · 독성)
물성=참조도구 일치도(r), 독성=용혈/비용혈 분류력(AUC).
| 항목 | 지표 |
|---|---|
| 물성: GRAVY/Instability | r=1.000/1.000 |
| 물성: pI/Boman | r=0.997/0.972 |
| 독성: 용혈 분류 AUC | 0.193 (n=14+10) |
결과: 물성 descriptor 계산은 검증된 참조도구와 r≈1.0 일치(정확).
그러나 pepADMET 용혈 독성 예측은 독립 AMP에서 AUC 0.19로 역전(LL-37·Cecropin 등 비용혈을 최독성 오판) — 범용 독성
라벨로 신뢰 불가, native 대비 상대 게이트로만 사용해야 함.
물성✓ / 독성✗자세히 →
기능별 상세
각 기능: 동작원리 · 영향 · 관련 Action Item · 완성도 · 학술가치 · 사용법 · (액션 무관 시) 필요이유.
🧪 벤치마크: 반감기 (문헌 vs 예측)
문헌 17종 실측 vs 예측 순위 — Spearman 정량+정성
검증·벤치마크자세히 →
🧫 벤치마크: ADMET (물성·독성)
물성 r≈1.0 정확 / 용혈 독성 AUC 0.19(역전) — 정직 검증
검증·벤치마크자세히 →
🧬 변이 엔진 & Scaffold 가드
변이 위치 선택 + 이황화·FWKT 보존 가드
발굴 파이프라인자세히 →
⚛️ PyRosetta 도킹 (실측 ΔG)
FlexPepDock 실측 ΔG, mock 없음, fail-closed
발굴 파이프라인자세히 →
🎯 선택성 · Δmargin
off-target 동일프로토콜 + home-advantage Δmargin
발굴 파이프라인자세히 →
📊 다목적 스코어링
NSGA-II Pareto + scalar + ECR consensus
발굴 파이프라인자세히 →
♾️ 무한 발굴 엔진
무한 epoch + 다양성 탈출 + 영속 학습
발굴 파이프라인자세히 →
⏳ 혈중 반감기 앙상블
휴리스틱+RF, Spearman 상대순위 간접검증
약리 surrogate자세히 →
🛡️ ADMET · 독성 게이트
surrogate + pepADMET hc50 native-relative 게이트
약리 surrogate자세히 →
🔍 탐색 최적화 (Bandit/BO/수렴)
Thompson bandit·베이지안·수렴감지
최적화·메타자세히 →
🤖 LLM 에이전트 (Planner/Critic/Reporter)
가설 주도 3-에이전트, vLLM no-think
최적화·메타자세히 →
✅ QC·검증 & fail-closed
QC 게이트 + fail-closed + 약리 가드
최적화·메타자세히 →
🧩 하네스 어댑테이션 (메타)
오케스트레이션 패턴·자가검증 메타 인프라
최적화·메타자세히 →
🌐 다양성 · 클러스터링
다양성 유지 + 구조 클러스터 tier
최적화·메타자세히 →
🖥️ 웹 UI (FastAPI+React+Mol*)
폴링 모니터링 + Mol* (무한엔진 미연결)
운영·UI자세히 →
⚖️ 기존 시스템 비교
RFdiffusion·AlphaProteo·pepADMET 등 비교
맥락·비교자세히 →
📚 학술·임상 맥락
SSTR2·PRRT·DOTATATE 임상 맥락
맥락·비교자세히 →