WAIC深度对话 | 中科院周园春:用数字身份证与智能体破解科研数据孤岛难题
2026-07-18 01:03:09未知 作者:徽声在线
“近年来,通过对国际高影响力期刊论文的深入分析发现,人工智能在科技创新领域的应用成果正呈现爆发式增长。”7月16日,在第九届世界人工智能大会(WAIC)开幕前夕,中国科学院计算机网络信息中心主任周园春在接受包括徽声在线在内的多家媒体联合采访时透露了这一观察。
当前,AI for Science已演变为科研领域的主流范式,算力资源、数据资产与算法模型构成科技创新的三大支柱。然而,科研数据分散存储、标准不一导致的‘数据孤岛’现象,仍严重阻碍着人工智能技术对科学发现的赋能效率。
针对这一行业痛点,周园春团队研发了具有公益属性的国际科学数据共享平台——科学数据银行(ScienceDB)。该平台通过为每个数据集分配全球唯一的数字标识符(CSTR),构建起完整的数据溯源体系,既能精准界定数据知识产权归属,又可实时追踪数据传播路径与引用情况。这种创新机制显著提升了科研人员的数据共享意愿。未来平台将依托国家人工智能应用中试基地,打造智能体时代的科学数据服务新生态,为全球开放科学治理提供技术支撑。
据周园春介绍,ScienceDB正在开发面向大模型训练的专用数据接口,计划通过标准化数据服务推动全球人工智能技术创新。
<
全球科研共同体加速数据共享进程
学术成果发表作为知识传播的核心渠道,长期面临数据造假、实验不可复现等诚信危机。国际学术出版界与科研机构普遍推行‘论文+数据’同步公开制度,科学数据银行正是顺应这一趋势打造的解决方案。
当前科学数据共享存在两种主要模式:财政资助项目的强制性数据汇交,以及遵循国际规范的论文关联数据自愿共享。ScienceDB聚焦后者,为全球科研人员提供论文支撑数据的存储、评议与再利用服务。研究人员在投稿时可将实验数据上传至平台,经同行评审后形成可追溯的数据资产。
《徽声在线》记者获悉,该平台已获得施普林格·自然、爱思唯尔等国际顶级出版商推荐,累计吸引150余个国家和地区的科研人员共享超过1500万组数据集。其创新实践被联合国教科文组织纳入开放科学典型案例库。
通过建立数据集与学术论文的强关联机制,平台不仅能有效验证研究成果的可复现性,遏制学术不端行为,更可减少重复数据采集带来的资源浪费。据测算,该模式可使科研数据复用效率提升40%以上,显著降低全球科研体系的运行成本。
周园春强调:‘这种具有国际影响力的共享平台,正在成为支撑人工智能全球治理的关键基础设施。’平台通过提供高质量、可信赖的科学数据底座,为跨国科研合作与AI技术标准制定奠定了基础。
双轨技术方案破解数据流通难题
尽管数据共享意义重大,但周园春坦言:‘科研数据孤岛现象仍未得到根本性改善。’大量珍贵数据因权属界定模糊、传播路径失控等问题被束之高阁,造成巨大资源浪费。调查显示,数据共享意愿不足仍是制约行业发展的首要因素。
‘科研人员担心数据被随意传播后失去知识产权保护,这是共享意愿低下的核心原因。’周园春团队从技术层面提出解决方案:首先通过CSTR标识体系为每个数据集颁发‘数字护照’,构建起覆盖数据全生命周期的溯源系统。这种国际通行的标识标准,使得数据贡献者能够获得应有的学术认可。
在数据使用权管理方面,团队创新性地引入‘数据智能体’概念。不同于传统集中式数据仓库,该方案允许数据所有者将数据封装为可调用的服务模块,研究者通过API接口获取分析结果而无法直接接触原始数据。周园春解释:‘这种物理分散、逻辑集中的架构,既保护了数据主权,又通过标准化接口实现了跨机构数据互联。’
该模式还内置了数据质量监控机制,要求数据提供者持续维护更新数据集。这种动态管理方式确保了共享数据的时效性与准确性,形成‘用养结合’的良性循环。目前平台已制定涵盖23个学科的数据封装标准,支持JSON、CSV等12种主流数据格式的智能体转换。
‘通过唯一标识与智能体技术的双重保障,我们正在构建去中心化的科学数据网络。’周园春表示,这种新型基础设施将打破机构壁垒,使珍贵科研数据真正成为全人类共享的智慧资源。据平台测试数据显示,采用智能体模式后,数据共享量同比增长215%,而数据泄露风险降低至传统模式的1/8。
随着FATE、TensorFlow Federated等联邦学习框架的成熟,科学数据银行正探索与隐私计算技术的深度融合。周园春透露,下一代平台将支持多方安全计算环境下的数据协同分析,为人工智能训练提供更丰富的合规数据源,推动全球科研范式向‘开放协作’加速演进。
