超100个AI药物进入临床阶段,AI制药为何仍被数据难题困扰?
2026-09-28 23:45:18未知 作者:徽声在线
徽声在线9月19日讯(记者 武超 于淼)在“2026张江药谷大会暨上海国际生物医药产业周‘未来智药:AI+制药前沿论坛’”上,众多专家学者围绕当前AI生物制药面临的挑战展开深入探讨,其中,数据问题成为焦点话题。
更确切地说,AI制药行业所面临的核心难题在于获取高质量数据,以及构建让数据能够持续回流的闭环体系。
全球范围内,AI辅助药物研发正呈现出爆发式增长态势。根据L.E.K. Consulting的统计数据,截至2025年,全球进入临床阶段的AI辅助药物分子数量已突破100个;与此同时,超过90家中国本土企业已与AI生物科技公司达成合作,共同推进药物研发进程。
巢生资本执行合伙人周悦欣也指出,相较于传统制药公司,AI制药公司更受资本市场的青睐。然而,在热度持续升温的背后,AI制药行业的发展仍面临诸多瓶颈。
数据稀缺:远不止“量”的不足
力场采样创始人彭向达认为,生物制药类模型与自然语言大模型在本质上存在显著差异。
“自然语言模型能够从海量的互联网文本数据中学习,但生物分子领域的高质量结构数据储备却相对匮乏。生物分子的作用机制极为复杂,当模型遇到未曾学习过的分子时,其预测性能就会出现明显下降。而在真实的药物研发场景中,研究对象大多为全新分子。”彭向达解释道。
“实际上,我们的数据非常稀缺。一个药物使用后,病人的表现如何变化,虽然之前可以采集大量临床数据,但整套的机理数据却很难获取。”上海科学智能研究院研究员杨自雄表示,“未来,或许会有更多仪器和方法论被提出,使我们能够获得多尺度、时间序列的数据,但目前还无法实现。”
这意味着,AI制药行业所缺乏的并非一般意义上的“大数据”,而是贴近真实药物研发过程的高质量、机制性数据。没有这些数据,即便模型再先进,也难以真正掌握“制药”的核心技能。
除了采集难度大之外,数据质量也直接影响着AI制药的效能。
上海交通大学数学科学学院和人工智能学院教授陈洛南强调,跨模态的配对数据对AI制药模型的训练至关重要,但目前行业可获取的数据大多为单模态数据。
“仅用单点数据观察某一数据切片会局限于单一维度,但通过时间扰动等手段获取不同时间维度的数据,就可以开展跨模态分析,实现有组织的数据输出。”临港实验室AI临床研究员袁博补充道。
模型开源后,数据生态成竞争关键
相比数据采集端的困难,腾讯健康首席架构师陈睿认为,模型本身并非AI制药面临的最大壁垒。
据陈睿介绍,腾讯在深科实验室开展了大量蛋白质相关研究,不少模型已经开源,供行业研究者使用。“我们开放模型的权重,就是因为深知模型本身并非最大的障碍。”
腾讯近期的重点布局是实验反馈强化学习。在陈睿看来,算力和算法只是做好AI赋能生物制药的入场券,而干湿实验的反馈闭环能力,以及各类数据,特别是失败的数据,才是破局的关键。
“我们更关注的是实验处理完成后,数据能否再反馈到模型中继续训练。在这个过程中,我们积累的数据以及工程发展能力更为重要。”陈睿说,“我认为大家更需要关注失败的数据,因为它们能提供宝贵的经验。”
从论坛上的讨论来看,AI制药的竞争逻辑正在发生转变。
过去,行业更关注谁的模型更大、算法更强、算力更多,但随着模型逐渐开源、算力逐渐普及,真正的壁垒将转向数据生态的构建。
“未来10年后,一定会有一批通过AI重构药物研发流程的伟大公司出现。”深势科技生命科学AI4S方向架构总经理李厦戎的这句话,代表了行业对AI制药的长期期待。
(徽声在线记者 武超 于淼)
