||
摘要:(目的)针对当前人工智能在生命科学领域"分子与细胞建模能力强、人体应答建模能力弱"的结构性缺口,北京深度甲基健康技术有限公司(DeepoMe)与清华大学未来实验室联合发表论文,提出人体响应智能(Human Response Intelligence)框架,旨在为虚拟患者构建可测试、可审计的人体尺度表征。(方法)论文发布评价与优化引擎 SteeraMed Bench,整合 332 个模块——覆盖扩展衰老标志、器官系统、免疫、营养与食源性干预,并纳入中医证候代理与药食同源靶点——在 1,916 个 DrugBank 小分子、五种慢性病任务(外推至 23 类疾病)的药物重定位场景下评估各模块组合的决策效用,并以 recall@20 为核心指标进行系统比较。(结论)结果表明,不存在普适最优的生物地图:全模块图谱仅在 23 类疾病中的 9 类严格最优;不同疾病各有最适配的模块组合,仅 117 个营养素及扩展模块的组合在五种疾病上的平均 recall@20(0.494)已接近 332 模块全图谱水平(0.524)。表征选择本身是可度量的决策质量驱动因素。该工作为可驾驭生物医学世界模型提供了坐标系与评价基准。
1 研究背景:人体应答建模的结构性缺口近年来,AI 驱动科研在生命科学领域的能力边界持续扩展:蛋白质结构预测被系统性改写,虚拟细胞系统已能模拟单细胞在扰动下的应答,生成式模型在分子设计任务上不断刷新纪录。然而,若追问一个更为实际的问题——对特定个体施加特定干预后,其整体生物状态将如何变化——现有模型大多难以作答。
换言之,在"人"这一层级——恰是药物研发价值兑现或归零的关键环节——系统性的建模基础设施仍付之阙如。这一缺口被概括为人体尺度建模(human-scale modeling)问题:需要回答哪些生物状态维度值得刻画、哪些患者可能应答、何种证据应指导下一次干预决策。
2 经济视角:II 期成败是价值兑现的关口《自然·药物发现综述》(Nature Reviews Drug Discovery)刊发的一篇观点文章,从研发成本角度论证了这一缺口的经济分量:将 II 期临床试验(药物能否在人体产生有意义获益的第一道检验)的失败率降低 20%,每次成功上市平均可节省近 9 亿美元;相较之下,在早期候选分子筛选环节的同等改进,对总研发成本的影响有限。该文同时指出,采用生物标志物识别可能应答者的临床项目,其单次成功上市的平均成本约为未分层项目的一半。
深度甲基团队对此的定位是:"我们优化的是 II 期成败这一环,每个成功上市药物对应近 9 亿美元的价值。"换言之,药物研发的主要成本并非发生在早期"选分子",而是发生在后期"人体应答"环节。
3 论文概况与 SteeraMed Bench 的定位近日,北京深度甲基健康技术有限公司(DeepoMe,下称"深度甲基")与清华大学未来实验室联合完成的研究《面向药物重定位的自学习智能体:为虚拟患者构建人体尺度表征》(Toward a Self-Learning AI Agent for Drug Repurposing: Building Human-Scale Representations for Virtual Patients)已在 Preprints.org 网站发布,相关工具可在SteeraMed网站查阅。
需要说明的是,SteeraMed——"可驾驭生物医学世界模型"框架——此前已由深度甲基首席科学家熊江辉博士在北京智源大会上系统介绍。本次发布的是该框架下的全新模块 SteeraMed Bench:一套面向人体尺度生物地图的评价与优化引擎,用于回答"哪套生物坐标对当前决策最有用"这一问题。
4 核心逻辑:用可驾驭世界模型,从虚拟细胞走向虚拟患者DeepoMe 正在构建人体响应智能,其核心逻辑可以概括为三步:用可驾驭世界模型算虚拟患者,预测一个人对干预有没有响应;干预后让他回来复测,预测准不准当场见分晓;而这正对着药物研发里最贵、也最有价值的那一刀——临床 II 期(每个成功上市药物对应近 9 亿美元,响应人群分层可将单个成功上市成本降至约一半)。
该框架将三类要素纳入统一基础设施:实测的人体生物状态(多维衰老信号、免疫、代谢、器官功能等)、结构化的干预(药物、营养、生活方式)与纵向观察到的响应(身体状态随时间的变化)。
深度甲基将长寿科学与衰老相关疾病选为该框架的初始学习域:此类场景天然满足可反复测量、状态多维、干预可修改与跨疾病相关四个条件,为人体生物学的纵向学习提供了现实可行的观测基础。
5 人体尺度生物地图:模块与表征人体响应智能的第一项任务是定义状态:确定用哪些生物维度刻画一个人,方能支撑特定决策。深度甲基的方案是一张人体尺度生物地图,包含两个层级:
模块:地图中可复用、与证据挂钩的基本单元,如衰老过程、免疫状态、器官功能、营养与暴露史;
表征:针对特定疾病、干预与响应问题,从地图中遴选的"决策就绪"的模块组合。
缺乏显式地图的世界模型,难以回答"从当前状态出发、施加干预后将到达何处"。在显式、可检验的人体状态、机制与干预表征上进行推理,被视为医学世界模型真正可驾驭的前提。
6 SteeraMed Bench:评价与优化方法
(论文 Figure 1:SteeraMed Bench 总体框架。开放获取,CC BY 4.0)
有了地图,随之而来的方法学问题是:众多模块及其组合中,哪张地图对当前决策最有用?SteeraMed Bench 对此给出可度量的回答:测试哪些模块及组合能切实改善干预推理,并将增益最强的组合遴选、整合为面向当前决策的优化地图。
在论文报告的分析中,SteeraMed Bench 整合 332 个模块,覆盖扩展衰老标志、器官系统、免疫、营养与食源性干预,并纳入中医证候代理与药食同源靶点;在 1,916 个 DrugBank 小分子、五种慢性病任务(外推至 23 类疾病)的药物重定位场景下评估效用。
核心结果有三:
其一,不存在普适最优的生物地图。全模块图谱在 23 类疾病中仅在 9 类严格最优;不同疾病各有最适配的坐标组合——扩展衰老标志组合在 2 型糖尿病、骨质疏松任务上领先,药食同源组合对抑郁任务最有力,营养素组合则在动脉粥样硬化/高脂血症任务中占优。
其二,表征选择是可度量的决策质量驱动因素。仅 117 个营养素及扩展模块的组合,在五种疾病上的平均 recall@20 达 0.494,已接近 332 模块全图谱的 0.524(recall@20:排序前 20 的候选中,命中已知药物-疾病关系的比例)。这一事实在过去多半只能依赖专家经验与默认的单一图谱来判断。
其三,论文如实报告了负面结果。大语言模型辅助提出的候选模块经多重检验校正后未见显著增量;留一疾病验证中性能接近随机。如实披露负面结果在方法论上具有说服力:说明该基准未对任何特定方法预设优势。
7 讨论:知识框架的量化检验框架还包含一套大语言模型辅助工作流,按照明确的效用与冗余标准提出并评估候选模块。以衰老研究界熟知的衰老标志框架为例:该框架已从 9 个标志扩展至 12 个,近期已进一步扩展至 14 个主要标志。此类科学框架传统上依赖专家对海量文献的综合研判;SteeraMed Bench 在此之上增加了一层量化检验——新提出的标志究竟是提升决策质量的独立维度,还是与既有表征冗余。这为科研人员评估与构建知识框架提供了定量工具。
8 专家评论"AI for Science 已经非常擅长看见分子和细胞,"熊江辉博士表示,"但在追问一项干预如何改变一个人之前,必须先定义对这个人、这项决策真正重要的生物状态。人类响应智能有两大任务:其一,识别最能表征人体状态的维度;其二,学习这些状态在干预之下可能如何变化。SteeraMed Bench 通过对模块进行评价与优化,让第一项任务变得可度量,为干预推理奠定最坚实的地图基础。"
9 应用前景对深度甲基而言,长寿科学与衰老相关疾病是这套基础设施的初始学习域。其多维衰老检测工作(包括 Capome)构成了对人体生物状态做纵向、可解释测量的入口;将反复测量与结构化干预暴露、随访相连接,方有条件学习"一项干预以何种方式、对哪些人改变状态"。
面向研究与药企伙伴,深度甲基正在开发一套可审计的转化决策工作流,用于药物重定位假设排序、候选应答人群定义以及下一个验证实验或纵向研究的设计。对衰老研究领域,这套基础设施的长远意义在于:将干预推理从人群层面的关联,逐步推向个体化 N-of-1 预测,并最终生成个体化的干预方案。
"虚拟患者"并非渲染出来的人体影像,亦非宣告完成的数字孪生,而是一套可测试、可审计的推演底座:识别与特定个体最相关的生物维度,对干预假设排序,辅以纵向随访,检验预测是否兑现。世界模型的下一阶段,比拼的可能不是参数规模,而是谁先积累可审计、可测试的人体表征资产。
参考文献Xiong J, Xia Q. Toward a Self-Learning AI Agent for Drug Repurposing: Building Human-Scale Representations for Virtual Patients. Preprints, 2026. DOI: 10.20944/preprints202608.0998.v1.
López-Otín C, Blasco MA, Partridge L, et al. The hallmarks of aging. Cell, 2013, 153(6): 1194-1217.
López-Otín C, Blasco MA, Partridge L, et al. Hallmarks of aging: An expanding universe. Cell, 2024, 187(2): 361-378.
说明:本文为科技资讯整理,文中研究尚未完成同行评审,不构成医疗诊断或治疗建议。
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-20 14:06
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社