智源研究院评估11款大模型:AI智能体或重塑生物安全风险格局
2026-07-25 17:57:18未知 作者:徽声在线
每经北京7月22日讯,当前,大语言模型正经历着从单纯的“聊天助手”向具备调用工具、自主规划任务能力的智能体形态的重大转变。这一转变不仅极大地拓展了其在生命科学领域的应用潜力,同时也引发了全新的生物安全风险挑战。
近期,智源研究院大模型安全研究团队携手北京大学,共同开展了一项端到端的系统性评估。评估结果显示,大语言模型智能体不仅有可能削弱现有的DNA合成筛查防线,更有可能向那些缺乏专业背景的用户提供原本需要专业训练才能掌握的实验操作知识,这无疑给生物安全带来了新的隐患。
为了全面评估智能体的能力,研究团队深入考察了其从方案生成、程序化计算校验,到受控湿实验验证的整个流程。并通过电泳和测序技术,确认了模型方案在物理层面的可执行性。此次评估涵盖了11个商用大语言模型,采用了国际生物安全与生物防护科学倡议(IBBIS)发布的Common Mechanism(通用筛查基准)作为DNA合成筛查的基线标准。
评估结果令人震惊,在分片设计环节,所有11个模型均能够生成能够绕过筛查的拆分方案。这一能力具有明显的双重用途风险:模型正在降低分片设计所需的专业知识门槛,使得那些缺乏相关背景的用户也有可能获得能够规避现有筛查机制的方案。这无疑暴露出以单条序列识别为主的DNA合成筛查体系存在着系统性的脆弱性。
尤为值得注意的是,GPT-5.5和Claude Opus 4.6这两个前沿模型已经能够生成较为完整的逐步实验操作方案。这表明,模型的风险已经从序列层面的计算设计延伸到了实验流程层面的知识支持,进一步加剧了生物安全的挑战。
研究团队指出,过去,这类任务高度依赖分子生物学专业知识与实验经验,相关的知识门槛本身就构成了一层防御。然而,大语言模型智能体的出现,正在将这一防御边界推向崩溃的边缘。它们正在将生命科学实验的知识门槛从“专业人员”降低到“非专业人员”,这既是技术进步的体现,也是安全治理必须严肃面对的问题。
针对这一严峻趋势,研究团队提出了一系列建议,包括在模型部署前进行严格的生物安全能力评估,加强智能体执行过程中的权限控制和风险监测,提升DNA合成筛查系统对AI辅助策略的识别能力,以及推动形成政府、模型开发者与生命科学社区共同参与的治理框架,以共同应对这一挑战。(记者可杨)
